Agent-Bench · v0.1 · Oppdatert 2026-07-05 · Foreløpig
Agent-Bench
Fleroperasjonsoppgaver med verktøy mot mock-registre; pass^k-pålitelighet.
Foreløpige resultater fra interne v0-kjøringer. Ikke sammenlignbare på tvers av versjoner.
Sammendrag
Agent-Bench måler evnen til å løse fleroperasjonsoppgaver med verktøy i norsk forvaltnings- og eiendomskontekst: dokumentsøk, Lovdata-oppslag, kalkulator og skjemautfylling mot mock-API-er for Kartverket, Brønnøysundregistrene og Lovdata. Hver oppgave har et entydig verifiserbart utfall etter GAIA-prinsippet og skåres med exact match eller tilstandssjekk. Pålitelighet rapporteres som pass^1 og pass^3 over tre kjøringer, etter tau-bench. Regelbrudd underveis registreres separat og medfører at kjøringen underkjennes.
Om suiten
- Oppgavetyper
- Fleroperasjonsløp i tre vanskelighetsnivåer: oppslag + kontroll, kryssjekk av dokument mot regelverk, og beregning + skjemautfylling.
- n per spor
- 96 oppgaver; hver kjørt tre ganger (288 kjøringer per modell).
- Metrikk
- pass^1 og pass^3 (%), utfallsbasert; k=3.
- Skåring
- Exact match på sluttsvar eller programmatisk tilstandssjekk av skjema/miljø; regelbrudd underkjenner kjøringen. Ingen LLM-as-judge.
- Verktøy
- Dokumentsøk, Lovdata-oppslag, kalkulator, skjemautfylling — identisk verktøysett for alle modeller.
- Holdout
- 25 % åpen dev-delmengde, 75 % privat holdout med årlig rotasjon.
- Målform
- Oppgaver og brukersimulering på bokmål i v0; nynorsk-spor er ikke etablert.
Norske forhold
- Mock-API-er speiler norske registre (Kartverket, Brønnøysundregistrene, Lovdata) med syntetiske data — reproduserbart og uten GDPR-eksponering.
- Brukersimulering på norsk tester dialogforståelse i tillegg til verktøybruk.
- Beregningsoppgaver bruker norsk tallformat og norske satser (depositum, mva, gebyrer) datert mot regelverksversjon.
Resultater
pass^1
Andel oppgaver løst i én enkelt kjøring, gjennomsnitt over tre kjøringer per oppgave.
| Rang | Modell | pass^1 (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–4 | Frontier A† | 66,7 | ±9,3 | 96 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 61,5 | ±9,7 | 96 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 55,2 | ±9,9 | 96 | 2026-06Intern v0 |
| 1–5 | Josefine 1 | 47,9 | ±10,0 | 96 | 2026-06Intern v0 |
| 3–5 | Åpen A† | 36,5 | ±9,6 | 96 | 2026-06Intern v0 |
1. Konfidensintervallene overlapper for flere modeller; rangeringen er statistisk uavgjort.
2. Kjøringer med regelbrudd regnes som ikke løst uavhengig av sluttsvar.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=96, privat holdout 75 %, 2026-06.
pass^3
Andel oppgaver løst i samtlige tre kjøringer. Måler pålitelighet, ikke beste forsøk.
| Rang | Modell | pass^3 (%) | 95 % KI | n | Kjøring |
|---|---|---|---|---|---|
| 1–3 | Frontier A† | 55,2 | ±9,9 | 96 | 2026-06Intern v0 |
| 1–4 | Frontier B† | 47,9 | ±10,0 | 96 | 2026-06Intern v0 |
| 1–5 | Frontier C† | 41,7 | ±9,8 | 96 | 2026-06Intern v0 |
| 2–5 | Josefine 1 | 34,4 | ±9,4 | 96 | 2026-06Intern v0 |
| 3–5 | Åpen A† | 24,0 | ±8,5 | 96 | 2026-06Intern v0 |
1. Gapet mellom pass^1 og pass^3 indikerer kjøringsvarians; alle modeller taper 11–14 prosentpoeng.
2. Konfidensintervallene overlapper for flere modeller; rangeringen er statistisk uavgjort.
† Anonymisert inntil verifisert kjøring foreligger.
Kjørt av Wammer, temperatur 0, 0-shot, n=96, privat holdout 75 %, 2026-06.
Metodikk
Oppgavene er fleroperasjonsløp i norsk forvaltnings- og eiendomskontekst, f.eks.: finn gjeldende depositumsregler, kontroller kontrakten, beregn korrekt beløp, formuler svar. Hvert løp krever 3–12 verktøykall og har et entydig verifiserbart utfall etter GAIA-prinsippet. Tre vanskelighetsnivåer med manuelt verifisert fasit, etter mønster fra SWE-bench Verified.
Alle verktøykall går mot deterministiske mock-API-er for Kartverket, Brønnøysundregistrene og Lovdata; miljøtilstanden nullstilles per kjøring. Domeneregler (taushetsplikt, beløpsgrenser, saksbehandlingsregler) håndheves som i tau-bench: brudd underkjenner kjøringen.
Hver oppgave kjøres tre ganger; pass^1 og pass^3 rapporteres separat for å skille kapasitet fra pålitelighet.
Skåring
- Exact match på sluttsvar eller programmatisk tilstandssjekk av skjema/miljø; ingen LLM-as-judge.
- Regelbrudd underveis underkjenner kjøringen uavhengig av sluttsvar.
- pass^1 = gjennomsnittlig løsningsandel per kjøring; pass^3 = løst i alle tre kjøringer.
- 95 % bootstrap-konfidensintervall over oppgaver, minst 1 000 resamples.
Kontaminasjonskontroll
Kanari-GUID i alle oppgavefiler. Mock-API-ene serverer syntetiske registerdata som ikke finnes i åpne kilder; oppgavene er nyskrevne og n-gram-sjekket mot åpne korpus. Ingen live-kall mot reelle registre.
Begrensninger
- Lavt n (96 oppgaver) gir brede konfidensintervall; de fleste parvise rangeringer er statistisk uavgjorte.
- Mock-API-ene forenkler reelle registre; skår overfører ikke direkte til produksjonsmiljø med live-kilder.
- k=3 er et minimum for pass^k; varians ved høyere k er ikke estimert.
- Kun bokmål i v0; nynorsk brukersimulering mangler.
- Verktøysettet er fast og begrenset; suiten måler ikke verktøyvalg i åpne miljøer.
Endringslogg
— v0.1 — første interne kjøring publisert. 96 oppgaver, pass^1 og pass^3 med k=3.
Referanser
Tredjepartsmodeller anonymiseres (Frontier A–C, Åpen A) inntil verifiserte kjøringer med publiserte logger foreligger. Josefine 1 navngis. Henvendelser: research@wammer.tech.