← Benchmarks

Agent-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig

Agent-Bench

Fleroperasjonsoppgaver med verktøy mot mock-registre; pass^k-pålitelighet.

Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.

Sammendrag

Agent-Bench måler evnen til å løse fleroperasjonsoppgaver med verktøy i norsk forvaltnings- og eiendomskontekst: dokumentsøk, Lovdata-oppslag, kalkulator og skjemautfylling mot mock-API-er for Kartverket, Brønnøysundregistrene og Lovdata. Hver oppgave har et entydig verifiserbart utfall etter GAIA-prinsippet og skåres med exact match eller tilstandssjekk. Pålitelighet rapporteres som pass^1 og pass^3 over tre kjøringer, etter tau-bench. Regelbrudd underveis registreres separat og medfører at kjøringen underkjennes.

Om suiten

Oppgavetyper
Fleroperasjonsløp i tre vanskelighetsnivåer: oppslag + kontroll, kryssjekk av dokument mot regelverk, og beregning + skjemautfylling.
n per spor
96 oppgaver; hver kjørt tre ganger (288 kjøringer per modell).
Metrikk
pass^1 og pass^3 (%), utfallsbasert; k=3.
Skåring
Exact match på sluttsvar eller programmatisk tilstandssjekk av skjema/miljø; regelbrudd underkjenner kjøringen. Ingen LLM-as-judge.
Verktøy
Dokumentsøk, Lovdata-oppslag, kalkulator, skjemautfylling — identisk verktøysett for alle modeller.
Holdout
25 % åpen dev-delmengde, 75 % privat holdout med årlig rotasjon.
Målform
Oppgaver og brukersimulering på bokmål i v0; nynorsk-spor er ikke etablert.

Norske forhold

  • Mock-API-er speiler norske registre (Kartverket, Brønnøysundregistrene, Lovdata) med syntetiske data — reproduserbart og uten GDPR-eksponering.
  • Brukersimulering på norsk tester dialogforståelse i tillegg til verktøybruk.
  • Beregningsoppgaver bruker norsk tallformat og norske satser (depositum, mva, gebyrer) datert mot regelverksversjon.

Resultater

pass^1

Andel oppgaver løst i én enkelt kjøring, gjennomsnitt over tre kjøringer per oppgave.

pass^1 — resultater, pass^1 (%)
RangModellpass^1 (%)95 % KInKjøring
1–4Frontier A66,7±9,3962026-06Intern v0
1–4Frontier B61,5±9,7962026-06Intern v0
1–5Frontier C55,2±9,9962026-06Intern v0
1–5Josefine 147,9±10,0962026-06Intern v0
3–5Åpen A36,5±9,6962026-06Intern v0

1. Konfidensintervallene overlapper for flere modeller; rangeringen er statistisk uavgjort.

2. Kjøringer med regelbrudd regnes som ikke løst uavhengig av sluttsvar.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=96, privat holdout 75 %, 2026-06.

pass^3

Andel oppgaver løst i samtlige tre kjøringer. Måler pålitelighet, ikke beste forsøk.

pass^3 — resultater, pass^3 (%)
RangModellpass^3 (%)95 % KInKjøring
1–3Frontier A55,2±9,9962026-06Intern v0
1–4Frontier B47,9±10,0962026-06Intern v0
1–5Frontier C41,7±9,8962026-06Intern v0
2–5Josefine 134,4±9,4962026-06Intern v0
3–5Åpen A24,0±8,5962026-06Intern v0

1. Gapet mellom pass^1 og pass^3 indikerer kjøringsvarians; alle modeller taper 11–14 prosentpoeng.

2. Konfidensintervallene overlapper for flere modeller; rangeringen er statistisk uavgjort.

† Anonymisert inntil verifisert kjøring foreligger.

Kjørt av Wammer, temperatur 0, 0-shot, n=96, privat holdout 75 %, 2026-06.

Metodikk

Oppgavene er fleroperasjonsløp i norsk forvaltnings- og eiendomskontekst, f.eks.: finn gjeldende depositumsregler, kontroller kontrakten, beregn korrekt beløp, formuler svar. Hvert løp krever 3–12 verktøykall og har et entydig verifiserbart utfall etter GAIA-prinsippet. Tre vanskelighetsnivåer med manuelt verifisert fasit, etter mønster fra SWE-bench Verified.

Alle verktøykall går mot deterministiske mock-API-er for Kartverket, Brønnøysundregistrene og Lovdata; miljøtilstanden nullstilles per kjøring. Domeneregler (taushetsplikt, beløpsgrenser, saksbehandlingsregler) håndheves som i tau-bench: brudd underkjenner kjøringen.

Hver oppgave kjøres tre ganger; pass^1 og pass^3 rapporteres separat for å skille kapasitet fra pålitelighet.

Skåring

  • Exact match på sluttsvar eller programmatisk tilstandssjekk av skjema/miljø; ingen LLM-as-judge.
  • Regelbrudd underveis underkjenner kjøringen uavhengig av sluttsvar.
  • pass^1 = gjennomsnittlig løsningsandel per kjøring; pass^3 = løst i alle tre kjøringer.
  • 95 % bootstrap-konfidensintervall over oppgaver, minst 1 000 resamples.

Kontaminasjonskontroll

Kanari-GUID i alle oppgavefiler. Mock-API-ene serverer syntetiske registerdata som ikke finnes i åpne kilder; oppgavene er nyskrevne og n-gram-sjekket mot åpne korpus. Ingen live-kall mot reelle registre.

Begrensninger

  • Lavt n (96 oppgaver) gir brede konfidensintervall; de fleste parvise rangeringer er statistisk uavgjorte.
  • Mock-API-ene forenkler reelle registre; skår overfører ikke direkte til produksjonsmiljø med live-kilder.
  • k=3 er et minimum for pass^k; varians ved høyere k er ikke estimert.
  • Kun bokmål i v0; nynorsk brukersimulering mangler.
  • Verktøysettet er fast og begrenset; suiten måler ikke verktøyvalg i åpne miljøer.

Endringslogg

v0.1 — første interne kjøring publisert. 96 oppgaver, pass^1 og pass^3 med k=3.

Referanser

  1. Mialon et al. (2023): GAIA — A Benchmark for General AI Assistants
  2. Yao et al. (2024): τ-bench — A Benchmark for Tool-Agent-User Interaction in Real-World Domains
  3. Liu et al. (2023): AgentBench — Evaluating LLMs as Agents
  4. OpenAI (2024): Introducing SWE-bench Verified

Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.