Benchmarks

Seks evalueringssuiter for språkmodeller på norsk fagspråk: juss, dokumentforståelse, tverrfaglig kunnskap, finans, lang kontekst og agentiske oppgaver.

v0 · foreløpige interne kjøringer · oppdatert 2026-07-05 · temperatur 0 · 0-shot

Status

v0-kjøringene er interne og ikke uavhengig reprodusert.

Tredjepartsmodeller anonymiseres inntil verifiserte kjøringer foreligger.

Rangeringer med overlappende konfidensintervall er statistisk uavgjorte.

Oversikt

Modeller mot suiter — primærmetrikk per suite med 95 % konfidensintervall
ModellJuss-BenchQA · Accuracy (%)Dok-BenchEnkeltdokument · Token-F1 (F1)Tverr-BenchFlervalg samlet · Accuracy (%)Fin-BenchNumerisk QA · Exact match (%)LK-BenchSyntetisk 8k · Accuracy (%)Agent-Benchpass^1 · pass^1 (%)
Josefine 171,2±3,676,8±3,472,5±2,655,4±6,388,3±3,147,9±10,0
Frontier A74,6±3,575,9±3,574,2±2,661,7±6,392,5±2,666,7±9,3
Frontier B72,9±3,673,4±3,670,9±2,858,3±6,291,1±2,861,5±9,7
Frontier C68,3±3,870,2±3,866,3±2,849,6±6,389,6±3,055,2±9,9
Åpen A60,8±3,962,5±4,158,7±2,937,9±6,384,2±3,636,5±9,6

Matrisen viser ett navngitt spor per suite; øvrige spor rapporteres på suite-sidene. Verdier er ikke sammenlignbare på tvers av suiter. Overlappende konfidensintervaller regnes som uavgjort.

† Anonymisert inntil verifisert kjøring foreligger.

Suiter

Metodikk

  • Temperatur 0 og identiske prompts for alle modeller.
  • 0-shot i alle spor.
  • Bootstrap-konfidensintervall, 95 %, minst 1 000 resamples.
  • 20–30 % åpen dev-andel, 70–80 % privat holdout.
  • Kanari-GUID og n-gram-sjekk mot kontaminasjon.
  • Årlig rotasjon av privat holdout.

Metodikk →

Anonymisering

Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis.

Referanser

  1. Liang et al. (2022): HELM — Holistic Evaluation of Language Models
  2. Guha et al. (2023): LegalBench — A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models
  3. Hsieh et al. (2024): RULER — What’s the Real Context Size of Your Long-Context Language Models?
  4. Bai et al. (2024): LongBench v2 — Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
  5. Mialon et al. (2023): GAIA — A Benchmark for General AI Assistants
  6. Yao et al. (2024): τ-bench — A Benchmark for Tool-Agent-User Interaction in Real-World Domains
  7. Chen et al. (2021): FinQA — A Dataset of Numerical Reasoning over Financial Data
  8. Wang et al. (2024): MMLU-Pro — A More Robust and Challenging Multi-Task Language Understanding Benchmark
  9. Dasigi et al. (2021): QASPER — A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers