LK-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig
LK-Bench
Effektiv kontekstlengde og global forståelse av lange norske dokumenter.
Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.
Sammendrag
LK-Bench måler effektiv kontekstlengde og global dokumentforståelse på norsk. Suiten kombinerer syntetiske oppgaver i RULER-stil ved fire lengdenivåer (8k–128k tokens) med realistisk QA over hele NOU-er, kontraktsbunker og kommuneplaner, samt parvise påstander i NoCha-stil der begge varianter må skåres riktig. Effektiv kontekstlengde rapporteres som lengste nivå med minst 85 % av 8k-skåren. Lengder måles i tokens per modell, ikke tegn.
Om suiten
- Oppgavetyper
- Syntetisk: NIAH-varianter, variable tracking, aggregering, multi-hop-sporing. Realistisk: flervalgs-QA og parvise påstander over hele dokumenter.
- n per spor
- 400 per lengdenivå (syntetisk), 160 (realistisk QA), 120 par (påstander).
- Metrikk
- Accuracy (%) per lengdenivå og for realistisk QA; par-accuracy (%) for påstander.
- Skåring
- Programmatisk exact match mot fasit; ingen LLM-as-judge i denne suiten.
- Effektiv kontekst
- Lengste nivå med minst 85 % av 8k-skåren. Terskelen er relativ til modellens egen 8k-skår; RULER bruker en absolutt terskel.
- Holdout
- 25 % åpen dev-delmengde, 75 % privat holdout med årlig rotasjon.
- Målform
- Syntetiske oppgaver på bokmål; realistiske kilder følger kildens målform.
Norske forhold
- NOU-er, stortingsmeldinger og lovforarbeider brukes som lange kilder — offentlige under NLOD-lisens.
- Norsk tokeniseres 20–40 % dyrere enn engelsk i mange tokenizers; lengdenivåer måles derfor i tokens per modell.
- Realistiske spørsmål krever kryssjekk mot norsk forvaltnings- og plankontekst, ikke bare tekstgjenfinning.
Resultater
Syntetiske lengdenivåer
Oppgaver i RULER-stil ved 8k–128k tokens; accuracy per nivå. Effektiv kontekst utledes som lengste nivå med minst 85 % av 8k-skåren.
| Modell | 8k | 32k | 64k | 128k | Effektiv kontekst |
|---|---|---|---|---|---|
| Josefine 1 | 88,3±3,1 | 84,9±3,5 | 78,1±4,1 | 68,4±4,6 | 64k |
| Frontier A† | 92,5±2,6 | 90,8±2,8 | 88,2±3,1 | 84,7±3,5 | 128k |
| Frontier B† | 91,1±2,8 | 88,4±3,2 | 84,6±3,5 | 78,9±4,1 | 128k |
| Frontier C† | 89,6±3,0 | 85,7±3,5 | 80,3±3,9 | 71,2±4,4 | 64k |
| Åpen A† | 84,2±3,6 | 77,6±4,1 | 66,9±4,6 | —2— | 32k |
Effektiv kontekst: lengste nivå med minst 85 % av 8k-skåren (relativ terskel; RULER bruker en absolutt).
1. Konfidensintervallene overlapper for flere modeller; rangeringen er statistisk uavgjort.
2. Åpen A har kontekstvindu under 128k tokens; nivået er ikke kjørt.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=400, privat holdout 75 %, 2026-06.
Realistisk QA
Flervalgs-QA over hele NOU-er, kontraktsbunker og kommuneplaner (30k–120k tokens). Svar krever global forståelse, ikke enkeltoppslag.
| Rang | Modell | Accuracy (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Frontier A† | 78,1 | ±6,5 | 160 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 75,0 | ±6,7 | 160 | 2026-06Intern v0 |
| 1–5 | Josefine 1 | 71,9 | ±6,9 | 160 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 70,6 | ±7,1 | 160 | 2026-06Intern v0 |
| 3–5 | Åpen A† | 58,8 | ±7,6 | 160 | 2026-06Intern v0 |
1. Lavt n gir brede konfidensintervall; alle rangeringer er statistisk uavgjorte.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=160, privat holdout 75 %, 2026-06.
Parvise påstander
Påstandsverifisering i NoCha-stil: par av sann og usann påstand om samme dokument der begge må skåres riktig. Straffer gjetting.
| Rang | Modell | Par-accuracy (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Frontier A† | 55,0 | ±9,0 | 120 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 50,8 | ±9,1 | 120 | 2026-06Intern v0 |
| 1–5 | Josefine 1 | 45,8 | ±9,0 | 120 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 43,3 | ±8,9 | 120 | 2026-06Intern v0 |
| 3–5 | Åpen A† | 30,0 | ±8,3 | 120 | 2026-06Intern v0 |
1. Tilfeldig gjetting gir 25 % forventet par-accuracy.
2. Konfidensintervallene overlapper for flere modeller; rangeringen er statistisk uavgjort.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=120, privat holdout 75 %, 2026-06.
Metodikk
Suiten har to lag. Det syntetiske laget følger RULER: fire oppgavetyper (NIAH-varianter, variable tracking, aggregering, multi-hop-sporing) genereres programmatisk på bokmål ved 8k, 32k, 64k og 128k tokens, 100 oppgaver per type og nivå. Distraktortekst hentes fra NLOD-lisensierte offentlige dokumenter.
Det realistiske laget bygger på LongBench v2 og NoCha: flervalgs-QA og parvise påstander over hele NOU-er, kontraktsbunker og kommuneplaner. Spørsmålene er nyskrevne av fagfolk og krever global forståelse av dokumentet, ikke gjenfinning av enkeltavsnitt.
Effektiv kontekstlengde rapporteres per modell som lengste nivå med minst 85 % av 8k-skåren. Terskelen er relativ til modellens egen 8k-skår, i motsetning til RULERs absolutte terskel; modeller med lav 8k-baseline møter dermed et lavere absolutt krav.
Skåring
- Programmatisk exact match mot fasit i alle spor; ingen LLM-as-judge.
- Par-accuracy krediterer kun par der både sann og usann påstand skåres riktig.
- 95 % bootstrap-konfidensintervall, minst 1 000 resamples over oppgaver.
- Temperatur 0, 0-shot, identiske prompts på tvers av modeller.
Kontaminasjonskontroll
Kanari-GUID i alle datafiler. Syntetiske oppgaver genereres programmatisk per kjøring og kan ikke ligge i treningsdata. Realistiske spørsmål er nyskrevne og n-gram-sjekket mot åpne korpus; kildedokumentene (NOU-er, kommuneplaner) er offentlige, men spørsmål og fasit er ikke publisert.
Begrensninger
- Syntetiske oppgaver måler primært gjenfinning og sporing; høy skår garanterer ikke resonnering over lang kontekst.
- Realistisk QA og påstandspar har lavt n (160/120); konfidensintervallene er brede og de fleste rangeringer statistisk uavgjorte.
- Åpen A er ikke kjørt på 128k-nivået. Modellens effektive kontekstlengde (32k) følger av målt degradering ved 64k og påvirkes ikke av det manglende nivået.
- Nivåer over 128k tokens er ikke dekket i v0.
- Én kjøring per konfigurasjon; varians mellom kjøringer er ikke estimert.
Endringslogg
— v0.1 — første interne kjøring publisert. Fire syntetiske lengdenivåer, realistisk QA og parvise påstander.
Referanser
- Hsieh et al. (2024): RULER — What’s the Real Context Size of Your Long-Context Language Models?
- Bai et al. (2024): LongBench v2 — Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
- Zhang et al. (2024): ∞Bench — Extending Long Context Evaluation Beyond 100K Tokens
- Karpinska et al. (2024): One Thousand and One Pairs — A “novel” challenge for long-context language models (NoCha)
Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.