Fin-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig
Fin-Bench
Numerisk QA og tabellresonnering over norske regnskap, prospekter og leieavtaler.
Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.
Sammendrag
Fin-Bench måler flerstegs numerisk resonnering over norske finansdokumenter: årsregnskap, prospekter og leieavtaler med KPI-tabeller. Suiten følger FinQA-prinsippet om execution accuracy og TAT-QA-mønsteret for hybride tabell- og tekstkilder. Skåringen er exact match med relativ toleranse ±0,5 % for å håndtere avrunding. Norsk tallformat, NGAAP/IFRS-skiller og norske mva-satser inngår i oppgavegrunnlaget.
Om suiten
- Oppgavetyper
- Numerisk QA over dokument + tabell; aggregering på tvers av rader og kolonner.
- Omfang
- 400 spørsmål: 240 numerisk QA, 160 tabellresonnering.
- Metrikk
- Exact match (%) med relativ toleranse ±0,5 %.
- Skåring
- Numerisk sammenligning mot fasit; valgfritt utregningsspor for feilanalyse.
- Holdout
- 25 % åpen dev-delmengde, 75 % privat holdout. Årlig rotasjon.
- Kontaminasjon
- Kanari-GUID i alle datafiler, n-gram-sjekk mot åpne korpus.
- Målform
- Bokmål. Kildedokumentene er reelle norske formater.
Norske forhold
- Norsk tallformat — komma som desimalskilletegn, mellomrom som tusenskilletegn — er en kjent snublestein og inngår i alle oppgaver.
- NGAAP mot IFRS: oppgaver skiller mellom regnskapsstandardene der det påvirker svaret.
- Norske mva-satser (25/15/12 %), NOK-beløp og Brønnøysund-formater i kildegrunnlaget.
- Yield- og leieberegninger er vektet opp i tråd med proptech-domenet.
Resultater
Numerisk QA
Flerstegs numerisk QA over dokument og tilhørende tabeller: nøkkeltall, avkastning, mva- og leieberegninger.
| Rang | Modell | Exact match (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Frontier A† | 61,7 | ±6,3 | 240 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 58,3 | ±6,2 | 240 | 2026-06Intern v0 |
| 1–4 | Josefine 1 | 55,4 | ±6,3 | 240 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 49,6 | ±6,3 | 240 | 2026-06Intern v0 |
| 4–5 | Åpen A† | 37,9 | ±6,3 | 240 | 2026-06Intern v0 |
1. Konfidensintervallene til de fire øverste modellene overlapper; rangeringen er statistisk uavgjort.
2. Svar med korrekt verdi i feil tallformat regnes som korrekt etter normalisering.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=240, privat holdout 75 %, 2026-06.
Tabellresonnering
Spørsmål som krever aggregering på tvers av rader og kolonner i KPI-tabeller, med og uten støttetekst.
| Rang | Modell | Exact match (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Frontier A† | 56,3 | ±7,6 | 160 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 53,1 | ±7,7 | 160 | 2026-06Intern v0 |
| 1–4 | Josefine 1 | 51,9 | ±7,8 | 160 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 43,8 | ±7,6 | 160 | 2026-06Intern v0 |
| 4–5 | Åpen A† | 31,9 | ±7,3 | 160 | 2026-06Intern v0 |
1. Konfidensintervallene til de fire øverste modellene overlapper; rangeringen er statistisk uavgjort.
2. Sporet er gjennomgående vanskeligere enn numerisk QA.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=160, privat holdout 75 %, 2026-06.
Metodikk
Oppgavene følger FinQA-mønsteret: flerstegs numerisk resonnering der svaret må beregnes fra tall i dokumentet, med execution accuracy som prinsipp. Tabellsporet følger TAT-QA: hybride kilder der tall står i tabell og forbehold står i tekst. Flerstegskrav er kalibrert mot GSM8K-nivå, oppgavetaksonomien mot FinBen.
Kildegrunnlaget er syntetiserte norske årsregnskap, prospekter og leieavtaler med KPI-tabeller, bygget etter reelle formater fra Brønnøysundregistrene. 400 spørsmål totalt, hvert annotert av regnskapskyndig.
Alle modeller kjøres 0-shot med temperatur 0 og identisk prompt-mal. Et valgfritt utregningsspor logges for feilanalyse, men inngår ikke i skåren.
Skåring
- Exact match mot fasitverdi med relativ toleranse ±0,5 %; håndterer avrunding uten å godta regnefeil.
- Numerisk normalisering før sammenligning: komma-desimal, tusenskilletegn, enhet (NOK, %, kvm).
- Ingen LLM-as-judge; all skåring er deterministisk.
- 95 % bootstrap-konfidensintervall over spørsmål, minst 1 000 resamples.
Kontaminasjonskontroll
Kanari-GUID i alle datafiler og n-gram-overlappsjekk mot åpne korpus. Tallgrunnlag og KPI-tabeller er syntetisert etter reelle norske dokumentformater, ikke hentet fra publiserte regnskap.
Begrensninger
- Syntetiserte dokumenter etter reelle formater; skår generaliserer ikke nødvendigvis til støyfulle produksjonsdokumenter med OCR-feil.
- Exact match med toleranse skiller ikke mellom regnefeil og lesefeil; utregningssporet brukes kun til intern feilanalyse.
- n=160 i tabellsporet gir konfidensintervall på ±7–8 prosentpoeng; forskjeller under dette nivået er ikke tolkbare.
- v0-kjøringene er interne og ikke uavhengig reprodusert.
Endringslogg
— v0.1 — første interne kjøring publisert. 400 spørsmål i to spor, fem modeller.
Referanser
- Chen et al. (2021): FinQA — A Dataset of Numerical Reasoning over Financial Data
- Zhu et al. (2021): TAT-QA — A Question Answering Benchmark on a Hybrid of Tabular and Textual Content in Finance
- Cobbe et al. (2021): GSM8K — Training Verifiers to Solve Math Word Problems
- Xie et al. (2024): FinBen — A Holistic Financial Benchmark for Large Language Models
- Chen et al. (2022): ConvFinQA — Exploring the Chain of Numerical Reasoning in Conversational Finance Question Answering
Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.