← Benchmarks

Tverr-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig

Tverr-Bench

Tverrfaglig flervalg på norsk: rett, utdanning, helse, forvaltning, plan og bygg samt offentlig økonomi.

Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.

Sammendrag

Tverr-Bench måler tverrfaglig kunnskap på norsk gjennom flervalgsspørsmål med ti alternativer, etter mønster fra MMLU-Pro. Suiten dekker seks domener: norsk rett, utdanning og pedagogikk, helse og trygd, offentlig saksbehandling, plan og bygg samt økonomi i offentlig forvaltning. Spørsmålene er nyskrevne på bokmål og nynorsk; oversatte spørsmål fra engelskspråklige benchmarks brukes ikke. Accuracy rapporteres samlet og for nynorsk-delmengden separat.

Om suiten

Oppgavetyper
Flervalg med ti svaralternativer, ett riktig svar per spørsmål.
Omfang
1 080 spørsmål fordelt på seks domener, 150–200 per domene.
Metrikk
Accuracy (%), makro-vektet på tvers av domener.
Skåring
Deterministisk svarekstraksjon mot fasit; ingen LLM-as-judge.
Holdout
25 % åpen dev-delmengde, 75 % privat holdout. Årlig rotasjon.
Kontaminasjon
Kanari-GUID i alle datafiler, n-gram-sjekk mot åpne korpus.
Målform
75 % bokmål, 25 % nynorsk. Nynorsk rapporteres separat.

Norske forhold

  • Norsk forvaltningspraksis — enkeltvedtak, klagefrist, Nav-regelverk — er unikt innhold uten dekning i etablerte benchmarks.
  • Målformfordeling 75/25 bokmål/nynorsk; nynorsk-delmengden rapporteres som eget spor (offentlig sektor har nynorskkrav).
  • Oversatte MMLU-spørsmål brukes ikke: maskinoversatte varianter måler oversettelsesrobusthet, ikke norsk kunnskap.
  • Bygget kompatibelt med NorEval, NLEBench og ScandEval/EuroEval.

Resultater

Flervalg samlet

Alle seks domener samlet. Flervalg med ti alternativer; accuracy makro-vektet på tvers av domener.

Flervalg samlet — resultater, Accuracy (%)
RangModellAccuracy (%)95 % KInKjøring
1–3Frontier A74,2±2,610802026-06Intern v0
1–3Josefine 172,5±2,610802026-06Intern v0
1–4Frontier B70,9±2,810802026-06Intern v0
3–4Frontier C66,3±2,810802026-06Intern v0
5Åpen A58,7±2,910802026-06Intern v0

1. Konfidensintervallene til Frontier A, Josefine 1 og Frontier B overlapper; rangeringen mellom dem er statistisk uavgjort.

2. Gjettebaseline er 10 % med ti alternativer.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=1080, privat holdout 75 %, 2026-06.

Nynorsk-delmengde

Nynorsk-spørsmålene rapportert separat, samme format og skåring som hovedsporet.

Nynorsk-delmengde — resultater, Accuracy (%)
RangModellAccuracy (%)95 % KInKjøring
1–4Josefine 170,7±5,42702026-06Intern v0
1–4Frontier A70,4±5,42702026-06Intern v0
1–4Frontier B65,9±5,62702026-06Intern v0
1–5Frontier C60,0±5,82702026-06Intern v0
4–5Åpen A51,1±5,92702026-06Intern v0

1. Konfidensintervallene til de fire øverste modellene overlapper; rangeringen er statistisk uavgjort.

2. Delmengde av hovedsporet (n=270 av 1 080), ikke et separat spørsmålssett.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=270, privat holdout 75 %, 2026-06.

Metodikk

Formatet følger MMLU-Pro: flervalg med ti alternativer i stedet for fire, som reduserer gjettebaseline fra 25 % til 10 % og krever mer resonnering per spørsmål. Domenevalget følger AGIEval-prinsippet om reelle fagkrav: spørsmålene er skrevet mot norske eksamens- og fagprøvenivåer i hvert domene, ikke hentet fra publiserte sett.

Seks domener med 150–200 spørsmål hver: norsk rett, utdanning og pedagogikk, helse og trygd, offentlig saksbehandling (forvaltningsloven, offentleglova), plan og bygg samt offentlig økonomi. Alle spørsmål er datert mot regelverksversjon.

Alle modeller kjøres 0-shot med temperatur 0 og identisk prompt-mal. Suiten er bygget kompatibelt med NorEval, NLEBench og ScandEval/EuroEval.

Skåring

  • Deterministisk ekstraksjon av valgt alternativ mot fasit; svar uten entydig alternativvalg skåres som feil.
  • Accuracy makro-vektet per domene, slik at domener med ulikt antall spørsmål teller likt.
  • 95 % bootstrap-konfidensintervall over spørsmål, minst 1 000 resamples.

Kontaminasjonskontroll

Kanari-GUID i alle datafiler og n-gram-overlappsjekk mot åpne norske korpus. Spørsmålene er nyskrevne; eksisterende eksamenssett gjenbrukes ikke. Alle fakta er datert.

Begrensninger

  • Flervalg måler gjenkjenning og utvelgelse, ikke fri produksjon av fagtekst; resultatene generaliserer ikke til åpne svarformater.
  • Domeneutvalget dekker seks fagområder; skår kan ikke tolkes som generell norsk fagkunnskap.
  • v0-kjøringene er interne og ikke uavhengig reprodusert; feil i enkeltspørsmål må påregnes og rettes i senere versjoner.
  • Nynorsk-delmengden (n=270) gir bredere konfidensintervall enn hovedsporet; små forskjeller mellom modeller er ikke tolkbare der.

Endringslogg

v0.1 — første interne kjøring publisert. 1 080 spørsmål, seks domener, fem modeller.

Referanser

  1. Hendrycks et al. (2021): MMLU — Measuring Massive Multitask Language Understanding
  2. Wang et al. (2024): MMLU-Pro — A More Robust and Challenging Multi-Task Language Understanding Benchmark
  3. Zhong et al. (2023): AGIEval — A Human-Centric Benchmark for Evaluating Foundation Models
  4. Mikhailov et al. (2025): NorEval — A Norwegian Language Understanding and Generation Evaluation Benchmark
  5. Liu et al. (2023): NLEBench+NorGLM — A Comprehensive Empirical Analysis and Benchmark Dataset for Generative Language Models in Norwegian
  6. Nielsen (2023): ScandEval — A Benchmark for Scandinavian Natural Language Processing

Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.