Dok-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig
Dok-Bench
QA og resonnering over norske kontrakter, rapporter og vedtak.
Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.
Sammendrag
Dok-Bench måler ekstraktiv og abstraktiv QA over norske fagdokumenter — leiekontrakter, tilstandsrapporter, årsregnskap og forvaltningsvedtak — i to spor. Enkeltdokument-sporet skårer token-F1 med ANLS for OCR-kilder og inkluderer «finnes ikke i dokumentet»-oppgaver som hallusineringskontroll, etter mønster fra MMLongBench-Doc. Flerdokument-sporet krever kryssjekk av 2–5 dokumenter og skårer evidence-F1 på avsnittsnivå i tillegg til svar-F1, etter HotpotQA-mønsteret. Alle dokumenter er syntetiserte eller anonymiserte.
Om suiten
- Oppgavetyper
- Ekstraktiv QA (58 %), abstraktiv QA (33 %), «finnes ikke i dokumentet» (9 %).
- Antall oppgaver
- n=480 enkeltdokument, n=220 flerdokument.
- Dokumenttyper
- Leiekontrakter, salgsoppgaver, tilstandsrapporter, årsregnskap, borettslagsvedtekter, kommunale vedtak.
- Metrikk
- Token-F1 (enkeltdokument; ANLS for OCR-kilder). Svar-F1 + evidence-F1 på avsnittsnivå (flerdokument).
- Skåring
- Deterministisk F1/ANLS mot fasit; ingen LLM-as-judge i denne suiten.
- Holdout
- 20 % åpen dev-delmengde, 80 % privat holdout. Årlig rotasjon.
- Kontaminasjon
- Kanari-GUID i alle dokumenter; alle dokumenter syntetiserte eller anonymiserte og finnes ikke i åpne korpus.
- Målform
- 85 % bokmål, 15 % nynorsk (kommunale vedtak fra nynorskkommuner).
Norske forhold
- Norske dokumenttyper (salgsoppgaver, borettslagsvedtekter, kommunale vedtak) finnes ikke strukturert i åpne treningskorpus — kontaminasjonsbeskyttelse i seg selv.
- GDPR: kun syntetiserte eller anonymiserte dokumenter; fiktive fødselsnumre er gyldige etter modulus 11-kontroll.
- Norsk tallformat (komma som desimalskilletegn, mellomrom som tusenskilletegn) i regnskaps- og takstdokumenter.
- Flerdokument-oppgavene kryssjekker kontrakt mot husleielov og takstrapport — norsk rettskildebruk inngår i fasit.
Resultater
Enkeltdokument
QA over ett dokument: kontrakter, tilstandsrapporter, årsregnskap og vedtak. Token-F1; ANLS for OCR-kilder.
| Rang | Modell | Token-F1 (F1) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Josefine 1 | 76,82 | ±3,4 | 480 | 2026-06Intern v0 |
| 1–4 | Frontier A† | 75,92 | ±3,5 | 480 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 73,4 | ±3,6 | 480 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 70,2 | ±3,8 | 480 | 2026-06Intern v0 |
| 4–5 | Åpen A† | 62,5 | ±4,1 | 480 | 2026-06Intern v0 |
1. «Finnes ikke i dokumentet»-andel korrekt: Josefine 1 81 % · Frontier A 76 % · Frontier B 74 % · Frontier C 69 % · Åpen A 55 %.
2. Konfidensintervallene for Josefine 1 og Frontier A overlapper; rangeringen er statistisk uavgjort.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=480, privat holdout 80 %, 2026-06.
Flerdokument
Resonnering på tvers av 2–5 dokumenter, f.eks. leiekontrakt mot husleielov og takstrapport. Svar-F1 som primærmetrikk; evidence-F1 på avsnittsnivå i fotnote.
| Rang | Modell | Svar-F1 (F1) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Frontier A† | 63,22 | ±6,0 | 220 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 61,52 | ±6,1 | 220 | 2026-06Intern v0 |
| 1–4 | Josefine 1 | 58,92 | ±6,2 | 220 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 55,1 | ±6,4 | 220 | 2026-06Intern v0 |
| 4–5 | Åpen A† | 44,6 | ±6,4 | 220 | 2026-06Intern v0 |
1. Evidence-F1 på avsnittsnivå (skala 0–100): Josefine 1 54 · Frontier A 57 · Frontier B 55 · Frontier C 48 · Åpen A 36.
2. Konfidensintervallene for Frontier A, Frontier B og Josefine 1 overlapper; rangeringen er statistisk uavgjort.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=220, privat holdout 80 %, 2026-06.
Metodikk
Enkeltdokument-sporet følger QASPER-designet (QA med krav om evidensutdrag) og DocVQA-praksis for OCR-kilder (ANLS-metrikk som tåler OCR-støy). «Finnes ikke i dokumentet»-oppgaver etter MMLongBench-Doc straffer hallusinering. Tabelltunge dokumenter følger MultiHiertt/TAT-DQA-mønsteret.
Flerdokument-sporet følger multi-hop-mønsteret fra HotpotQA og 2WikiMultihopQA: hvert spørsmål krever informasjon fra minst to dokumenter, med annotert evidenssett på avsnittsnivå.
Alle dokumenter er syntetiserte av fagfolk eller anonymiserte med samtykke; spørsmål og fasit er annotert av fagfolk, ikke crowdsourcet.
Skåring
- Token-F1 mot fasitsvar etter SQuAD-normalisering tilpasset norsk (bestemthetsbøyning, sammensatte ord).
- ANLS for oppgaver med OCR-kilde (12 % av enkeltdokument-sporet).
- «Finnes ikke i dokumentet»: binær skåring; enhver innholdspåstand regnes som feil.
- Flerdokument: evidence-F1 på avsnittsnivå mot annotert evidenssett, i tillegg til svar-F1.
- 95 % bootstrap-KI, 1 000 resamples over oppgaver.
Kontaminasjonskontroll
Kanari-GUID i alle dokumentfiler. Dokumentene er syntetiserte eller anonymiserte med samtykke og finnes ikke i åpne korpus; n-gram-sjekk kjøres likevel mot åpne norske korpus. Fiktive fødselsnumre er gyldige etter modulus 11-kontroll uten å kollidere med reelle.
Begrensninger
- Syntetiserte dokumenter kan avvike stilistisk fra reelle; realismen er vurdert av fagfolk, ikke målt.
- Flerdokument-sporet har n=220; konfidensintervallene er brede og skiller ikke de tre øverste modellene.
- Ingen retrieval-komponent i v0; alle dokumenter ligger i konteksten samtidig.
- OCR-andelen (12 %) er for liten for egne konfidensintervall per kildetype.
- Interne v0-kjøringer, ikke uavhengig reprodusert.
Endringslogg
— v0.1 — første interne kjøring publisert. n=480 enkeltdokument, n=220 flerdokument.
Referanser
- Dasigi et al. (2021): QASPER — A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers
- Mathew et al. (2021): DocVQA — A Dataset for VQA on Document Images
- Ma et al. (2024): MMLongBench-Doc — Benchmarking Long-context Document Understanding
- Yang et al. (2018): HotpotQA — A Dataset for Diverse, Explainable Multi-hop Question Answering
- Ho et al. (2020): 2WikiMultihopQA — Constructing a Multi-hop QA Dataset for Comprehensive Evaluation
- Zhao et al. (2022): MultiHiertt — Numerical Reasoning over Multi Hierarchical Tabular and Textual Data
Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.