Metodikk · v0 · Oppdatert 2026-07-05
Metodikk
Felles normer for de seks evalueringssuitene. Avvik dokumenteres per suite.
Standardisering
Alle modeller evalueres under identiske betingelser innen hvert spor. Normene gjelder samtlige kjøringer:
- Temperatur 0 og identiske prompts for alle modeller.
- 0-shot i alle spor.
- Bootstrap-konfidensintervall, 95 %, minst 1 000 resamples.
- 20–30 % åpen dev-andel, 70–80 % privat holdout.
- Kanari-GUID og n-gram-sjekk mot kontaminasjon.
- Årlig rotasjon av privat holdout.
Usikkerhet og konfidensintervall
Alle punktestimater rapporteres med 95 % bootstrap-konfidensintervall beregnet over oppgaver, minst 1 000 resamples. Parvise sammenligninger mellom modeller vurderes mot overlapp i konfidensintervallene.
Rangeringer med overlappende konfidensintervall regnes som statistisk uavgjorte. Rang rapporteres derfor som intervall («1–2»), aldri som naiv rangering av punktestimater.
LLM-as-judge-protokoll
Deterministisk skåring brukes der oppgaveformatet tillater det. Fritekstsvar skåres av en fast dommer-modell med låst snapshot mot skriftlig rubrikk utarbeidet av fagperson. Dommer-modellen er aldri blant de testede modellene.
Enighet med menneskelig skåring måles med Cohens kappa på stikkprøver og rapporteres per suite. Rubrikk og dommer-snapshot versjoneres sammen med suiten.
Kontaminasjonskontroll
Alle datafiler inneholder kanari-GUID. Oppgaver n-gram-sjekkes mot åpne korpus før publisering, og alle spørsmål er nyskrevne for suitene. Syntetiske oppgaver genereres programmatisk per kjøring og kan ikke ligge i treningsdata.
Suite-spesifikke tiltak dokumenteres på hver suite-side.
Versjonering
Hver suite er versjonert. Resultater er sammenlignbare kun innen samme versjon; endringer i oppgavesett, skåring eller prompts gir ny versjon. Eldre resultater arkiveres i endringsloggen og slettes aldri.
Holdout
20–30 % av hver suite publiseres som åpen dev-delmengde; 70–80 % holdes privat og kjøres kun via Wammer. Privat holdout roteres årlig; roterte oppgaver arkiveres og gjenbrukes ikke.
Provenance
Hver skår refererer en navngitt kjøring med provenance-nivå: intern v0, intern, verifisert eller leverandørrapportert. v0 inneholder kun interne kjøringer. Verifiserte kjøringer med publiserte logger lenkes når de foreligger; tredjepartsmodeller anonymiseres inntil da.
Ingen totalindeks i v0
Suitene aggregeres ikke til én samleindeks. Metrikker og oppgavefordelinger er ikke kommensurable på tvers av suiter, og en vektet indeks ville skjult usikkerheten i enkeltsporene. Hver suite rapporteres separat.
Endringslogg
— Juss-Bench: v0.1 — første interne kjøring publisert. n=612 per spor, fem rettsområder.
— Dok-Bench: v0.1 — første interne kjøring publisert. n=480 enkeltdokument, n=220 flerdokument.
— Tverr-Bench: v0.1 — første interne kjøring publisert. 1 080 spørsmål, seks domener, fem modeller.
— Fin-Bench: v0.1 — første interne kjøring publisert. 400 spørsmål i to spor, fem modeller.
— LK-Bench: v0.1 — første interne kjøring publisert. Fire syntetiske lengdenivåer, realistisk QA og parvise påstander.
— Agent-Bench: v0.1 — første interne kjøring publisert. 96 oppgaver, pass^1 og pass^3 med k=3.
Referanser
- Liang et al. (2022): HELM — Holistic Evaluation of Language Models
- Miller (2024): Adding Error Bars to Evals — A Statistical Approach to Language Model Evaluations
- Zheng et al. (2023): Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
- Sainz et al. (2023): NLP Evaluation in Trouble — On the Need to Measure LLM Data Contamination
- Efron & Tibshirani (1993): An Introduction to the Bootstrap. Chapman & Hall.