← Benchmarks

LK-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig

LK-Bench

Effektiv kontekstlengde og global forståelse av lange norske dokumenter.

Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.

Sammendrag

LK-Bench måler effektiv kontekstlengde og global dokumentforståelse på norsk. Suiten kombinerer syntetiske oppgaver i RULER-stil ved fire lengdenivåer (8k–128k tokens) med realistisk QA over hele NOU-er, kontraktsbunker og kommuneplaner, samt parvise påstander i NoCha-stil der begge varianter må skåres riktig. Effektiv kontekstlengde rapporteres som lengste nivå med minst 85 % av 8k-skåren. Lengder måles i tokens per modell, ikke tegn.

Om suiten

Oppgavetyper
Syntetisk: NIAH-varianter, variable tracking, aggregering, multi-hop-sporing. Realistisk: flervalgs-QA og parvise påstander over hele dokumenter.
n per spor
400 per lengdenivå (syntetisk), 160 (realistisk QA), 120 par (påstander).
Metrikk
Accuracy (%) per lengdenivå og for realistisk QA; par-accuracy (%) for påstander.
Skåring
Programmatisk exact match mot fasit; ingen LLM-as-judge i denne suiten.
Effektiv kontekst
Lengste nivå med minst 85 % av 8k-skåren. Terskelen er relativ til modellens egen 8k-skår; RULER bruker en absolutt terskel.
Holdout
25 % åpen dev-delmengde, 75 % privat holdout med årlig rotasjon.
Målform
Syntetiske oppgaver på bokmål; realistiske kilder følger kildens målform.

Norske forhold

  • NOU-er, stortingsmeldinger og lovforarbeider brukes som lange kilder — offentlige under NLOD-lisens.
  • Norsk tokeniseres 20–40 % dyrere enn engelsk i mange tokenizers; lengdenivåer måles derfor i tokens per modell.
  • Realistiske spørsmål krever kryssjekk mot norsk forvaltnings- og plankontekst, ikke bare tekstgjenfinning.

Resultater

Syntetiske lengdenivåer

Oppgaver i RULER-stil ved 8k–128k tokens; accuracy per nivå. Effektiv kontekst utledes som lengste nivå med minst 85 % av 8k-skåren.

Syntetiske lengdenivåer — accuracy (%) per nivå med 95 % konfidensintervall og effektiv kontekst
Modell8k32k64k128kEffektiv kontekst
Josefine 188,3±3,184,9±3,578,1±4,168,4±4,664k
Frontier A92,5±2,690,8±2,888,2±3,184,7±3,5128k
Frontier B91,1±2,888,4±3,284,6±3,578,9±4,1128k
Frontier C89,6±3,085,7±3,580,3±3,971,2±4,464k
Åpen A84,2±3,677,6±4,166,9±4,6232k

Effektiv kontekst: lengste nivå med minst 85 % av 8k-skåren (relativ terskel; RULER bruker en absolutt).

1. Konfidensintervallene overlapper for flere modeller; rangeringen er statistisk uavgjort.

2. Åpen A har kontekstvindu under 128k tokens; nivået er ikke kjørt.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=400, privat holdout 75 %, 2026-06.

Realistisk QA

Flervalgs-QA over hele NOU-er, kontraktsbunker og kommuneplaner (30k–120k tokens). Svar krever global forståelse, ikke enkeltoppslag.

Realistisk QA — resultater, Accuracy (%)
RangModellAccuracy (%)95 % KInKjøring
1–4Frontier A78,1±6,51602026-06Intern v0
1–4Frontier B75,0±6,71602026-06Intern v0
1–5Josefine 171,9±6,91602026-06Intern v0
1–5Frontier C70,6±7,11602026-06Intern v0
3–5Åpen A58,8±7,61602026-06Intern v0

1. Lavt n gir brede konfidensintervall; alle rangeringer er statistisk uavgjorte.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=160, privat holdout 75 %, 2026-06.

Parvise påstander

Påstandsverifisering i NoCha-stil: par av sann og usann påstand om samme dokument der begge må skåres riktig. Straffer gjetting.

Parvise påstander — resultater, Par-accuracy (%)
RangModellPar-accuracy (%)95 % KInKjøring
1–4Frontier A55,0±9,01202026-06Intern v0
1–4Frontier B50,8±9,11202026-06Intern v0
1–5Josefine 145,8±9,01202026-06Intern v0
1–5Frontier C43,3±8,91202026-06Intern v0
3–5Åpen A30,0±8,31202026-06Intern v0

1. Tilfeldig gjetting gir 25 % forventet par-accuracy.

2. Konfidensintervallene overlapper for flere modeller; rangeringen er statistisk uavgjort.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=120, privat holdout 75 %, 2026-06.

Metodikk

Suiten har to lag. Det syntetiske laget følger RULER: fire oppgavetyper (NIAH-varianter, variable tracking, aggregering, multi-hop-sporing) genereres programmatisk på bokmål ved 8k, 32k, 64k og 128k tokens, 100 oppgaver per type og nivå. Distraktortekst hentes fra NLOD-lisensierte offentlige dokumenter.

Det realistiske laget bygger på LongBench v2 og NoCha: flervalgs-QA og parvise påstander over hele NOU-er, kontraktsbunker og kommuneplaner. Spørsmålene er nyskrevne av fagfolk og krever global forståelse av dokumentet, ikke gjenfinning av enkeltavsnitt.

Effektiv kontekstlengde rapporteres per modell som lengste nivå med minst 85 % av 8k-skåren. Terskelen er relativ til modellens egen 8k-skår, i motsetning til RULERs absolutte terskel; modeller med lav 8k-baseline møter dermed et lavere absolutt krav.

Skåring

  • Programmatisk exact match mot fasit i alle spor; ingen LLM-as-judge.
  • Par-accuracy krediterer kun par der både sann og usann påstand skåres riktig.
  • 95 % bootstrap-konfidensintervall, minst 1 000 resamples over oppgaver.
  • Temperatur 0, 0-shot, identiske prompts på tvers av modeller.

Kontaminasjonskontroll

Kanari-GUID i alle datafiler. Syntetiske oppgaver genereres programmatisk per kjøring og kan ikke ligge i treningsdata. Realistiske spørsmål er nyskrevne og n-gram-sjekket mot åpne korpus; kildedokumentene (NOU-er, kommuneplaner) er offentlige, men spørsmål og fasit er ikke publisert.

Begrensninger

  • Syntetiske oppgaver måler primært gjenfinning og sporing; høy skår garanterer ikke resonnering over lang kontekst.
  • Realistisk QA og påstandspar har lavt n (160/120); konfidensintervallene er brede og de fleste rangeringer statistisk uavgjorte.
  • Åpen A er ikke kjørt på 128k-nivået. Modellens effektive kontekstlengde (32k) følger av målt degradering ved 64k og påvirkes ikke av det manglende nivået.
  • Nivåer over 128k tokens er ikke dekket i v0.
  • Én kjøring per konfigurasjon; varians mellom kjøringer er ikke estimert.

Endringslogg

v0.1 — første interne kjøring publisert. Fire syntetiske lengdenivåer, realistisk QA og parvise påstander.

Referanser

  1. Hsieh et al. (2024): RULER — What’s the Real Context Size of Your Long-Context Language Models?
  2. Bai et al. (2024): LongBench v2 — Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
  3. Zhang et al. (2024): ∞Bench — Extending Long Context Evaluation Beyond 100K Tokens
  4. Karpinska et al. (2024): One Thousand and One Pairs — A “novel” challenge for long-context language models (NoCha)

Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.