← Benchmarks

Fin-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig

Fin-Bench

Numerisk QA og tabellresonnering over norske regnskap, prospekter og leieavtaler.

Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.

Sammendrag

Fin-Bench måler flerstegs numerisk resonnering over norske finansdokumenter: årsregnskap, prospekter og leieavtaler med KPI-tabeller. Suiten følger FinQA-prinsippet om execution accuracy og TAT-QA-mønsteret for hybride tabell- og tekstkilder. Skåringen er exact match med relativ toleranse ±0,5 % for å håndtere avrunding. Norsk tallformat, NGAAP/IFRS-skiller og norske mva-satser inngår i oppgavegrunnlaget.

Om suiten

Oppgavetyper
Numerisk QA over dokument + tabell; aggregering på tvers av rader og kolonner.
Omfang
400 spørsmål: 240 numerisk QA, 160 tabellresonnering.
Metrikk
Exact match (%) med relativ toleranse ±0,5 %.
Skåring
Numerisk sammenligning mot fasit; valgfritt utregningsspor for feilanalyse.
Holdout
25 % åpen dev-delmengde, 75 % privat holdout. Årlig rotasjon.
Kontaminasjon
Kanari-GUID i alle datafiler, n-gram-sjekk mot åpne korpus.
Målform
Bokmål. Kildedokumentene er reelle norske formater.

Norske forhold

  • Norsk tallformat — komma som desimalskilletegn, mellomrom som tusenskilletegn — er en kjent snublestein og inngår i alle oppgaver.
  • NGAAP mot IFRS: oppgaver skiller mellom regnskapsstandardene der det påvirker svaret.
  • Norske mva-satser (25/15/12 %), NOK-beløp og Brønnøysund-formater i kildegrunnlaget.
  • Yield- og leieberegninger er vektet opp i tråd med proptech-domenet.

Resultater

Numerisk QA

Flerstegs numerisk QA over dokument og tilhørende tabeller: nøkkeltall, avkastning, mva- og leieberegninger.

Numerisk QA — resultater, Exact match (%)
RangModellExact match (%)95 % KInKjøring
1–4Frontier A61,7±6,32402026-06Intern v0
1–4Frontier B58,3±6,22402026-06Intern v0
1–4Josefine 155,4±6,32402026-06Intern v0
1–5Frontier C49,6±6,32402026-06Intern v0
4–5Åpen A37,9±6,32402026-06Intern v0

1. Konfidensintervallene til de fire øverste modellene overlapper; rangeringen er statistisk uavgjort.

2. Svar med korrekt verdi i feil tallformat regnes som korrekt etter normalisering.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=240, privat holdout 75 %, 2026-06.

Tabellresonnering

Spørsmål som krever aggregering på tvers av rader og kolonner i KPI-tabeller, med og uten støttetekst.

Tabellresonnering — resultater, Exact match (%)
RangModellExact match (%)95 % KInKjøring
1–4Frontier A56,3±7,61602026-06Intern v0
1–4Frontier B53,1±7,71602026-06Intern v0
1–4Josefine 151,9±7,81602026-06Intern v0
1–5Frontier C43,8±7,61602026-06Intern v0
4–5Åpen A31,9±7,31602026-06Intern v0

1. Konfidensintervallene til de fire øverste modellene overlapper; rangeringen er statistisk uavgjort.

2. Sporet er gjennomgående vanskeligere enn numerisk QA.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=160, privat holdout 75 %, 2026-06.

Metodikk

Oppgavene følger FinQA-mønsteret: flerstegs numerisk resonnering der svaret må beregnes fra tall i dokumentet, med execution accuracy som prinsipp. Tabellsporet følger TAT-QA: hybride kilder der tall står i tabell og forbehold står i tekst. Flerstegskrav er kalibrert mot GSM8K-nivå, oppgavetaksonomien mot FinBen.

Kildegrunnlaget er syntetiserte norske årsregnskap, prospekter og leieavtaler med KPI-tabeller, bygget etter reelle formater fra Brønnøysundregistrene. 400 spørsmål totalt, hvert annotert av regnskapskyndig.

Alle modeller kjøres 0-shot med temperatur 0 og identisk prompt-mal. Et valgfritt utregningsspor logges for feilanalyse, men inngår ikke i skåren.

Skåring

  • Exact match mot fasitverdi med relativ toleranse ±0,5 %; håndterer avrunding uten å godta regnefeil.
  • Numerisk normalisering før sammenligning: komma-desimal, tusenskilletegn, enhet (NOK, %, kvm).
  • Ingen LLM-as-judge; all skåring er deterministisk.
  • 95 % bootstrap-konfidensintervall over spørsmål, minst 1 000 resamples.

Kontaminasjonskontroll

Kanari-GUID i alle datafiler og n-gram-overlappsjekk mot åpne korpus. Tallgrunnlag og KPI-tabeller er syntetisert etter reelle norske dokumentformater, ikke hentet fra publiserte regnskap.

Begrensninger

  • Syntetiserte dokumenter etter reelle formater; skår generaliserer ikke nødvendigvis til støyfulle produksjonsdokumenter med OCR-feil.
  • Exact match med toleranse skiller ikke mellom regnefeil og lesefeil; utregningssporet brukes kun til intern feilanalyse.
  • n=160 i tabellsporet gir konfidensintervall på ±7–8 prosentpoeng; forskjeller under dette nivået er ikke tolkbare.
  • v0-kjøringene er interne og ikke uavhengig reprodusert.

Endringslogg

v0.1 — første interne kjøring publisert. 400 spørsmål i to spor, fem modeller.

Referanser

  1. Chen et al. (2021): FinQA — A Dataset of Numerical Reasoning over Financial Data
  2. Zhu et al. (2021): TAT-QA — A Question Answering Benchmark on a Hybrid of Tabular and Textual Content in Finance
  3. Cobbe et al. (2021): GSM8K — Training Verifiers to Solve Math Word Problems
  4. Xie et al. (2024): FinBen — A Holistic Financial Benchmark for Large Language Models
  5. Chen et al. (2022): ConvFinQA — Exploring the Chain of Numerical Reasoning in Conversational Finance Question Answering

Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.