Tverr-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig
Tverr-Bench
Tverrfaglig flervalg på norsk: rett, utdanning, helse, forvaltning, plan og bygg samt offentlig økonomi.
Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.
Sammendrag
Tverr-Bench måler tverrfaglig kunnskap på norsk gjennom flervalgsspørsmål med ti alternativer, etter mønster fra MMLU-Pro. Suiten dekker seks domener: norsk rett, utdanning og pedagogikk, helse og trygd, offentlig saksbehandling, plan og bygg samt økonomi i offentlig forvaltning. Spørsmålene er nyskrevne på bokmål og nynorsk; oversatte spørsmål fra engelskspråklige benchmarks brukes ikke. Accuracy rapporteres samlet og for nynorsk-delmengden separat.
Om suiten
- Oppgavetyper
- Flervalg med ti svaralternativer, ett riktig svar per spørsmål.
- Omfang
- 1 080 spørsmål fordelt på seks domener, 150–200 per domene.
- Metrikk
- Accuracy (%), makro-vektet på tvers av domener.
- Skåring
- Deterministisk svarekstraksjon mot fasit; ingen LLM-as-judge.
- Holdout
- 25 % åpen dev-delmengde, 75 % privat holdout. Årlig rotasjon.
- Kontaminasjon
- Kanari-GUID i alle datafiler, n-gram-sjekk mot åpne korpus.
- Målform
- 75 % bokmål, 25 % nynorsk. Nynorsk rapporteres separat.
Norske forhold
- Norsk forvaltningspraksis — enkeltvedtak, klagefrist, Nav-regelverk — er unikt innhold uten dekning i etablerte benchmarks.
- Målformfordeling 75/25 bokmål/nynorsk; nynorsk-delmengden rapporteres som eget spor (offentlig sektor har nynorskkrav).
- Oversatte MMLU-spørsmål brukes ikke: maskinoversatte varianter måler oversettelsesrobusthet, ikke norsk kunnskap.
- Bygget kompatibelt med NorEval, NLEBench og ScandEval/EuroEval.
Resultater
Flervalg samlet
Alle seks domener samlet. Flervalg med ti alternativer; accuracy makro-vektet på tvers av domener.
| Rang | Modell | Accuracy (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–3 | Frontier A† | 74,2 | ±2,6 | 1080 | 2026-06Intern v0 |
| 1–3 | Josefine 1 | 72,5 | ±2,6 | 1080 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 70,9 | ±2,8 | 1080 | 2026-06Intern v0 |
| 3–4 | Frontier C† | 66,3 | ±2,8 | 1080 | 2026-06Intern v0 |
| 5 | Åpen A† | 58,7 | ±2,9 | 1080 | 2026-06Intern v0 |
1. Konfidensintervallene til Frontier A, Josefine 1 og Frontier B overlapper; rangeringen mellom dem er statistisk uavgjort.
2. Gjettebaseline er 10 % med ti alternativer.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=1080, privat holdout 75 %, 2026-06.
Nynorsk-delmengde
Nynorsk-spørsmålene rapportert separat, samme format og skåring som hovedsporet.
| Rang | Modell | Accuracy (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Josefine 1 | 70,7 | ±5,4 | 270 | 2026-06Intern v0 |
| 1–4 | Frontier A† | 70,4 | ±5,4 | 270 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 65,9 | ±5,6 | 270 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 60,0 | ±5,8 | 270 | 2026-06Intern v0 |
| 4–5 | Åpen A† | 51,1 | ±5,9 | 270 | 2026-06Intern v0 |
1. Konfidensintervallene til de fire øverste modellene overlapper; rangeringen er statistisk uavgjort.
2. Delmengde av hovedsporet (n=270 av 1 080), ikke et separat spørsmålssett.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=270, privat holdout 75 %, 2026-06.
Metodikk
Formatet følger MMLU-Pro: flervalg med ti alternativer i stedet for fire, som reduserer gjettebaseline fra 25 % til 10 % og krever mer resonnering per spørsmål. Domenevalget følger AGIEval-prinsippet om reelle fagkrav: spørsmålene er skrevet mot norske eksamens- og fagprøvenivåer i hvert domene, ikke hentet fra publiserte sett.
Seks domener med 150–200 spørsmål hver: norsk rett, utdanning og pedagogikk, helse og trygd, offentlig saksbehandling (forvaltningsloven, offentleglova), plan og bygg samt offentlig økonomi. Alle spørsmål er datert mot regelverksversjon.
Alle modeller kjøres 0-shot med temperatur 0 og identisk prompt-mal. Suiten er bygget kompatibelt med NorEval, NLEBench og ScandEval/EuroEval.
Skåring
- Deterministisk ekstraksjon av valgt alternativ mot fasit; svar uten entydig alternativvalg skåres som feil.
- Accuracy makro-vektet per domene, slik at domener med ulikt antall spørsmål teller likt.
- 95 % bootstrap-konfidensintervall over spørsmål, minst 1 000 resamples.
Kontaminasjonskontroll
Kanari-GUID i alle datafiler og n-gram-overlappsjekk mot åpne norske korpus. Spørsmålene er nyskrevne; eksisterende eksamenssett gjenbrukes ikke. Alle fakta er datert.
Begrensninger
- Flervalg måler gjenkjenning og utvelgelse, ikke fri produksjon av fagtekst; resultatene generaliserer ikke til åpne svarformater.
- Domeneutvalget dekker seks fagområder; skår kan ikke tolkes som generell norsk fagkunnskap.
- v0-kjøringene er interne og ikke uavhengig reprodusert; feil i enkeltspørsmål må påregnes og rettes i senere versjoner.
- Nynorsk-delmengden (n=270) gir bredere konfidensintervall enn hovedsporet; små forskjeller mellom modeller er ikke tolkbare der.
Endringslogg
— v0.1 — første interne kjøring publisert. 1 080 spørsmål, seks domener, fem modeller.
Referanser
- Hendrycks et al. (2021): MMLU — Measuring Massive Multitask Language Understanding
- Wang et al. (2024): MMLU-Pro — A More Robust and Challenging Multi-Task Language Understanding Benchmark
- Zhong et al. (2023): AGIEval — A Human-Centric Benchmark for Evaluating Foundation Models
- Mikhailov et al. (2025): NorEval — A Norwegian Language Understanding and Generation Evaluation Benchmark
- Liu et al. (2023): NLEBench+NorGLM — A Comprehensive Empirical Analysis and Benchmark Dataset for Generative Language Models in Norwegian
- Nielsen (2023): ScandEval — A Benchmark for Scandinavian Natural Language Processing
Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.