← Benchmarks

Dok-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig

Dok-Bench

QA og resonnering over norske kontrakter, rapporter og vedtak.

Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.

Sammendrag

Dok-Bench måler ekstraktiv og abstraktiv QA over norske fagdokumenter — leiekontrakter, tilstandsrapporter, årsregnskap og forvaltningsvedtak — i to spor. Enkeltdokument-sporet skårer token-F1 med ANLS for OCR-kilder og inkluderer «finnes ikke i dokumentet»-oppgaver som hallusineringskontroll, etter mønster fra MMLongBench-Doc. Flerdokument-sporet krever kryssjekk av 2–5 dokumenter og skårer evidence-F1 på avsnittsnivå i tillegg til svar-F1, etter HotpotQA-mønsteret. Alle dokumenter er syntetiserte eller anonymiserte.

Om suiten

Oppgavetyper
Ekstraktiv QA (58 %), abstraktiv QA (33 %), «finnes ikke i dokumentet» (9 %).
Antall oppgaver
n=480 enkeltdokument, n=220 flerdokument.
Dokumenttyper
Leiekontrakter, salgsoppgaver, tilstandsrapporter, årsregnskap, borettslagsvedtekter, kommunale vedtak.
Metrikk
Token-F1 (enkeltdokument; ANLS for OCR-kilder). Svar-F1 + evidence-F1 på avsnittsnivå (flerdokument).
Skåring
Deterministisk F1/ANLS mot fasit; ingen LLM-as-judge i denne suiten.
Holdout
20 % åpen dev-delmengde, 80 % privat holdout. Årlig rotasjon.
Kontaminasjon
Kanari-GUID i alle dokumenter; alle dokumenter syntetiserte eller anonymiserte og finnes ikke i åpne korpus.
Målform
85 % bokmål, 15 % nynorsk (kommunale vedtak fra nynorskkommuner).

Norske forhold

  • Norske dokumenttyper (salgsoppgaver, borettslagsvedtekter, kommunale vedtak) finnes ikke strukturert i åpne treningskorpus — kontaminasjonsbeskyttelse i seg selv.
  • GDPR: kun syntetiserte eller anonymiserte dokumenter; fiktive fødselsnumre er gyldige etter modulus 11-kontroll.
  • Norsk tallformat (komma som desimalskilletegn, mellomrom som tusenskilletegn) i regnskaps- og takstdokumenter.
  • Flerdokument-oppgavene kryssjekker kontrakt mot husleielov og takstrapport — norsk rettskildebruk inngår i fasit.

Resultater

Enkeltdokument

QA over ett dokument: kontrakter, tilstandsrapporter, årsregnskap og vedtak. Token-F1; ANLS for OCR-kilder.

Enkeltdokument — resultater, Token-F1 (F1)
RangModellToken-F1 (F1)95 % KInKjøring
1–4Josefine 176,82±3,44802026-06Intern v0
1–4Frontier A75,92±3,54802026-06Intern v0
1–4Frontier B73,4±3,64802026-06Intern v0
1–5Frontier C70,2±3,84802026-06Intern v0
4–5Åpen A62,5±4,14802026-06Intern v0

1. «Finnes ikke i dokumentet»-andel korrekt: Josefine 1 81 % · Frontier A 76 % · Frontier B 74 % · Frontier C 69 % · Åpen A 55 %.

2. Konfidensintervallene for Josefine 1 og Frontier A overlapper; rangeringen er statistisk uavgjort.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=480, privat holdout 80 %, 2026-06.

Flerdokument

Resonnering på tvers av 2–5 dokumenter, f.eks. leiekontrakt mot husleielov og takstrapport. Svar-F1 som primærmetrikk; evidence-F1 på avsnittsnivå i fotnote.

Flerdokument — resultater, Svar-F1 (F1)
RangModellSvar-F1 (F1)95 % KInKjøring
1–4Frontier A63,22±6,02202026-06Intern v0
1–4Frontier B61,52±6,12202026-06Intern v0
1–4Josefine 158,92±6,22202026-06Intern v0
1–5Frontier C55,1±6,42202026-06Intern v0
4–5Åpen A44,6±6,42202026-06Intern v0

1. Evidence-F1 på avsnittsnivå (skala 0–100): Josefine 1 54 · Frontier A 57 · Frontier B 55 · Frontier C 48 · Åpen A 36.

2. Konfidensintervallene for Frontier A, Frontier B og Josefine 1 overlapper; rangeringen er statistisk uavgjort.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=220, privat holdout 80 %, 2026-06.

Metodikk

Enkeltdokument-sporet følger QASPER-designet (QA med krav om evidensutdrag) og DocVQA-praksis for OCR-kilder (ANLS-metrikk som tåler OCR-støy). «Finnes ikke i dokumentet»-oppgaver etter MMLongBench-Doc straffer hallusinering. Tabelltunge dokumenter følger MultiHiertt/TAT-DQA-mønsteret.

Flerdokument-sporet følger multi-hop-mønsteret fra HotpotQA og 2WikiMultihopQA: hvert spørsmål krever informasjon fra minst to dokumenter, med annotert evidenssett på avsnittsnivå.

Alle dokumenter er syntetiserte av fagfolk eller anonymiserte med samtykke; spørsmål og fasit er annotert av fagfolk, ikke crowdsourcet.

Skåring

  • Token-F1 mot fasitsvar etter SQuAD-normalisering tilpasset norsk (bestemthetsbøyning, sammensatte ord).
  • ANLS for oppgaver med OCR-kilde (12 % av enkeltdokument-sporet).
  • «Finnes ikke i dokumentet»: binær skåring; enhver innholdspåstand regnes som feil.
  • Flerdokument: evidence-F1 på avsnittsnivå mot annotert evidenssett, i tillegg til svar-F1.
  • 95 % bootstrap-KI, 1 000 resamples over oppgaver.

Kontaminasjonskontroll

Kanari-GUID i alle dokumentfiler. Dokumentene er syntetiserte eller anonymiserte med samtykke og finnes ikke i åpne korpus; n-gram-sjekk kjøres likevel mot åpne norske korpus. Fiktive fødselsnumre er gyldige etter modulus 11-kontroll uten å kollidere med reelle.

Begrensninger

  • Syntetiserte dokumenter kan avvike stilistisk fra reelle; realismen er vurdert av fagfolk, ikke målt.
  • Flerdokument-sporet har n=220; konfidensintervallene er brede og skiller ikke de tre øverste modellene.
  • Ingen retrieval-komponent i v0; alle dokumenter ligger i konteksten samtidig.
  • OCR-andelen (12 %) er for liten for egne konfidensintervall per kildetype.
  • Interne v0-kjøringer, ikke uavhengig reprodusert.

Endringslogg

v0.1 — første interne kjøring publisert. n=480 enkeltdokument, n=220 flerdokument.

Referanser

  1. Dasigi et al. (2021): QASPER — A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers
  2. Mathew et al. (2021): DocVQA — A Dataset for VQA on Document Images
  3. Ma et al. (2024): MMLongBench-Doc — Benchmarking Long-context Document Understanding
  4. Yang et al. (2018): HotpotQA — A Dataset for Diverse, Explainable Multi-hop Question Answering
  5. Ho et al. (2020): 2WikiMultihopQA — Constructing a Multi-hop QA Dataset for Comprehensive Evaluation
  6. Zhao et al. (2022): MultiHiertt — Numerical Reasoning over Multi Hierarchical Tabular and Textual Data

Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.