Juss-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig
Juss-Bench
Juridisk QA på norsk rett, med og uten kildeoppslag.
Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.
Sammendrag
Juss-Bench måler juridisk spørsmålsbesvarelse på norsk rett i to spor: rene QA-oppgaver uten verktøy og samme oppgaver med oppslag i frosset Lovdata-speil (QA+T). Oppgavesettet dekker fem rettsområder med minst 100 oppgaver hver og kombinerer flervalg, binær regelanvendelse og korte fritekstsvar. Taksonomien følger IRAC-rammeverket fra LegalBench; QA+T-sporet skårer i tillegg siteringspresisjon på paragrafnivå. Hvert spørsmål er datert mot lovversjon.
Om suiten
- Oppgavetyper
- Flervalg (52 %), binær regelanvendelse (30 %), kort fritekst (18 %).
- Antall oppgaver
- n=612 per spor; samme oppgavesett i QA og QA+T. Minst 100 per rettsområde.
- Rettsområder
- Husleierett, avtalerett, forvaltningsrett, arbeidsrett, personvern.
- Metrikk
- Accuracy (%), balansert per rettsområde. QA+T rapporterer i tillegg sitering-F1 på paragrafnivå.
- Skåring
- Flervalg og binære oppgaver skåres deterministisk. Fritekst skåres med fast dommer-modell mot 3-punkts juristrubrikk (hjemmel, konklusjon, resonnement); kappa 0,81 mot jurist-stikkprøve.
- Holdout
- 25 % åpen dev-delmengde, 75 % privat holdout. Årlig rotasjon.
- Kontaminasjon
- Kanari-GUID i alle datafiler, n-gram-sjekk mot åpne korpus, kun nyskrevne spørsmål.
- Målform
- 80 % bokmål, 20 % nynorsk. Nynorskandelen inkluderer spørsmål mot lover vedtatt på nynorsk.
Norske forhold
- Norsk rett dekkes ikke av etablerte benchmarks; modeller trent på amerikansk og EU-rettslig materiale kan svare feil med høy konfidens.
- Oppgavene skiller mellom preseptorisk og deklaratorisk rett.
- Hvert spørsmål er versjonert mot Lovdata-dato; lovendringer utløser re-annotering.
- Lover vedtatt på nynorsk inngår som naturlig målformstest.
Resultater
QA
Spørsmålsbesvarelse uten verktøytilgang. Flervalg, binær regelanvendelse og kort fritekst; accuracy balansert per rettsområde.
| Rang | Modell | Accuracy (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Frontier A† | 74,6 | ±3,5 | 612 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 72,9 | ±3,6 | 612 | 2026-06Intern v0 |
| 1–4 | Josefine 1 | 71,2 | ±3,6 | 612 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 68,3 | ±3,8 | 612 | 2026-06Intern v0 |
| 4–5 | Åpen A† | 60,82 | ±3,9 | 612 | 2026-06Intern v0 |
1. Fritekstandelen (18 %) skåres med LLM-as-judge mot 3-punkts juristrubrikk; enighet med jurist-stikkprøve: Cohens kappa 0,81.
2. Åpen A kjørt med leverandørens standard chat-mal; øvrig oppsett identisk.
Konfidensintervallene overlapper; rangeringen er statistisk uavgjort.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=612, privat holdout 75 %, 2026-06.
QA+T
Samme oppgavesett med oppslag i frosset Lovdata-speil og forskriftsdatabase. Accuracy som primærmetrikk; sitering-F1 på paragrafnivå rapporteres i fotnote.
| Rang | Modell | Accuracy (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Frontier A† | 82,42 | ±3,1 | 612 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 80,92 | ±3,2 | 612 | 2026-06Intern v0 |
| 1–4 | Josefine 1 | 80,12 | ±3,3 | 612 | 2026-06Intern v0 |
| 1–4 | Frontier C† | 76,22 | ±3,4 | 612 | 2026-06Intern v0 |
| 5 | Åpen A† | 67,42 | ±3,7 | 612 | 2026-06Intern v0 |
1. Verktøytilgang: frosset Lovdata-speil og forskriftsdatabase (kopi 2026-05), maks 8 kall per oppgave.
2. Sitering-F1 på paragrafnivå (skala 0–100): Josefine 1 74 · Frontier A 71 · Frontier B 69 · Frontier C 63 · Åpen A 52.
Konfidensintervallene overlapper; rangeringen er statistisk uavgjort.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=612, privat holdout 75 %, 2026-06.
Metodikk
Oppgavetaksonomien følger IRAC-rammeverket (issue, rule, application, conclusion) fra LegalBench, med LawBench-inndelingen i tre kognitive nivåer: memorering, forståelse, anvendelse. Metrikkvalget (accuracy balansert per rettsområde) følger LexGLUE-praksis for klassifikasjons- og QA-oppgaver på ett nasjonalt rettssystem.
QA+T-sporet følger retrieval-augmentert QA-design fra FreshQA/CRAG og LegalBench-RAG: samme spørsmål, verktøytilgang til frosset kildekopi, og separat skåring av om oppgitt hjemmel faktisk er relevant.
Alle spørsmål er skrevet av jurister for denne suiten og datert mot lovversjon. Fordeling per rettsområde er fastlåst; nye rettsområder gir ny minor-versjon.
Skåring
- Flervalg og binær regelanvendelse: deterministisk exact match.
- Kort fritekst: fast dommer-modell (låst snapshot 2026-05) mot 3-punkts rubrikk — hjemmel korrekt sitert, konklusjon riktig, resonnement holdbart. Dommer-modell er ikke blant de testede. Cohens kappa 0,81 mot jurist-stikkprøve (n=100).
- QA+T: sitering-F1 på paragrafnivå mot fasit-hjemler, i tillegg til accuracy.
- 95 % bootstrap-KI, 1 000 resamples over oppgaver.
Kontaminasjonskontroll
Kanari-GUID i alle datafiler. N-gram-overlappsjekk mot åpne norske korpus. Alle spørsmål er nyskrevne; eksisterende eksamenssett brukes ikke. Hvert spørsmål er datert mot Lovdata-versjon (2026-05).
Begrensninger
- Fem rettsområder; dekker ikke strafferett, skatterett eller tingsrett.
- Fritekstskåring avhenger av dommer-modellen; kappa 0,81 innebærer kjent restuenighet.
- Interne v0-kjøringer, ikke uavhengig reprodusert.
- Lovversjoner er frosset per 2026-05; svar som er riktige etter senere lovendring regnes som feil.
- Nynorskandelen (20 %) er for liten for egne konfidensintervall per målform.
Endringslogg
— v0.1 — første interne kjøring publisert. n=612 per spor, fem rettsområder.
Referanser
- Guha et al. (2023): LegalBench — A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models
- Fei et al. (2023): LawBench — Benchmarking Legal Knowledge of Large Language Models
- Chalkidis et al. (2022): LexGLUE — A Benchmark Dataset for Legal NLP in English
- Pipitone & Houir Alami (2024): LegalBench-RAG — A Benchmark for Retrieval-Augmented Generation in the Legal Domain
- Vu et al. (2023): FreshLLMs — Refreshing Large Language Models with Search Engine Augmentation
- Yang et al. (2024): CRAG — Comprehensive RAG Benchmark
Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.