analyse · 18. juli 2026

Kritikken mot KI er billig

Tre grafer viser utviklingen gjennom flere år, hundrevis av modeller og en rekke leverandører.

Kritikken mot KI i Norge går i sirkel. Modellen smigrer. Modellen hallusinerer. Modellen er for dum. Dette er reelle problemer. De blir samtidig målt, trent på og redusert i et tempo den norske debatten knapt forholder seg til.

Tre grafer viser utviklingen. De dekker flere år, hundrevis av modeller og en rekke leverandører. Tallene gjør det vanskelig å hevde at problemene står stille.

Intelligensen øker ekstremt raskt

Den første grafen inneholder 563 modell- og innstillingspunkter fra 2022 til 2026. Modellene er plassert ved releasedato. Noen punkter er direkte evaluert. Resten er estimert etter samme publiserte metode.

GPT‑3.5 Turbo startet på 3,6 poeng. GPT‑4 nådde 7,0 i mars 2023. Claude 3 Opus fikk 11,8 året etter. Deretter kom reasoning-modellene. OpenAI o1 nådde 23,4. Claude 3.7 Sonnet fikk 27,1. o3 løftet nivået til 30,4. GPT‑5 high kom opp i 34,7. Gemini 3 Pro Preview high nådde 39,6.

I 2026 går kurven brattere. GPT‑5.4 xhigh fikk 51,4. Opus 4.7 max nådde 53,5. Opus 4.8 max fikk 55,7. GPT‑5.5 xhigh ligger på 54,8. GPT‑5.6 Sol max ligger på 58,9. Kimi K3 følger rett bak med 57,1.

Øverst ligger et Fable 5-oppsett på 59,9. Det bruker Adaptive Reasoning, Max Effort og Opus 4.8 som fallback. Punktet må derfor beskrives som et oppsett. GPT‑5.6 Sol vises også i flere rader fordi max, xhigh og high er ulike reasoning-innstillinger.

563 modell- og innstillingspunkter · høyere er bedre

Intelligence Index etter releasedato

563

punkter totalt

150

direkte evaluert

3,6 → 59,9

under fire år

0+10+20+30+40+50+602023202420252026OpenAI-estimert · 45 punkterMeta-estimert · 12 punkterAnthropic-estimert · 24 punkterGoogle-estimert · 46 punkterAlibaba-estimert · 58 punkterMistral-estimert · 19 punkterDeepSeek-estimert · 24 punkterAndre kinesiske laboratorier-estimert · 48 punkterAndre-estimert · 113 punkterAndre-evaluert · 17 punkterSpaceXAI-estimert · 18 punkterMeta-evaluert · 6 punkterAnthropic-evaluert · 10 punkterDeepSeek-evaluert · 7 punkterOpenAI-evaluert · 36 punkterGoogle-evaluert · 10 punkterMistral-evaluert · 13 punkterAlibaba-evaluert · 23 punkterKimi-estimert · 6 punkterAndre kinesiske laboratorier-evaluert · 20 punkterKimi-evaluert · 4 punkterSpaceXAI-evaluert · 4 punkterGPT-3.5 Turbo · 3,6GPT-4 · 7,0Claude 3 Opus · 11,8o1 · 23,4o3 · 30,4Gemini 3 Pro Preview (high) · 39,6GPT-5.4 (xhigh) · 51,4Claude Fable 5 · 59,9
OpenAIAnthropicGoogleKimiAlibabaDeepSeekMetaSpaceXAIMistralAndre

Små, svake punkter er estimerte. Større punkter er direkte evaluert. Den gule linjen viser beste publiserte score blant modellene som var sluppet på hvert tidspunkt.

Toppen 18. juli 2026

1. Claude Fable 5 (with fallback)59,9
2. GPT-5.6 Sol (max)58,9
3. Kimi K357,1
4. Claude Opus 4.8 (max)55,7
5. GPT-5.5 (xhigh)54,8

Fable-resultatet bruker Adaptive Reasoning, Max Effort og Opus 4.8 som fallback. Når flere innstillinger slås sammen per modellfamilie, ligger Kimi K3 på tredjeplass.

Dette er en release-date scatter basert på benchmarkmetoden som var publisert ved uttrekket 18. juli 2026. Punktene viser dagens score plassert ved modellens releasedato. Reasoning effort og andre inference-innstillinger står som egne punkter. 150 punkter er direkte evaluert; resten er estimerte.Artificial Analysis LLM Leaderboard · Metode for Intelligence Index

På under fire år har nivået gått fra 3,6 til 59,9. Dagens topp består av Fable 5-oppsettet, GPT‑5.6 Sol og Kimi K3.

Modellene leverer langt flere riktige svar

Den andre grafen har 446 punkter fra 2023 til 2026. Her bruker vi Omniscience Index. Den regnes som prosent korrekte svar minus prosent ukorrekte svar. Avståelse er nøytral.

Mistral 7B lå på −64,8 i 2023. Claude 3 Haiku fikk −47,6. Llama 3.1 405B kom opp til −17,3. GPT‑4o fra november 2024 nådde −10,8. Claude 3.7 Sonnet passerte null med +0,3. Gemini 3.1 Pro Preview nådde +32,9. Fable 5-oppsettet ligger på +40,2.

De nyeste modellene viser også store forskjeller. Opus 4.7 max får +26,2. Opus 4.8 max får +27,4. GPT‑5.5 xhigh ligger på +20,1. GPT‑5.6 Sol max ligger på +21,7. Kimi K3 får +18,4.

Rå hallusinasjonsrate alene gir et skjevt bilde. Modeller som forsøker å svare på flere spørsmål kan få høyere rate, selv om antallet riktige svar øker kraftig. Kimi K2.6 hadde 32,8 prosent accuracy og 39,3 prosent rå hallusinasjonsrate. Kimi K3 økte accuracy til 46,0 prosent, samtidig som den rå raten steg til 50,9 prosent.

446 punkter · riktig minus feil

Omniscience Index etter releasedato

446

sammenlignbare punkter

−64,8

frontier i 2023

+40,2

frontier i 2026

-100-75-50-250+25+502023202420252026Mistral-evaluert · 22 punkterAndre-evaluert · 104 punkterAnthropic-evaluert · 23 punkterMeta-evaluert · 12 punkterOpenAI-evaluert · 67 punkterAlibaba-evaluert · 67 punkterDeepSeek-evaluert · 21 punkterGoogle-evaluert · 37 punkterSpaceXAI-evaluert · 18 punkterAndre kinesiske laboratorier-evaluert · 66 punkterKimi-evaluert · 9 punkterMistral 7B · −64,8Llama 3.1 405B · −17,3Claude 3.7 Sonnet · 0,3Gemini 3.1 Pro Preview · 32,9Claude Fable 5 · 40,2
OpenAIAnthropicGoogleKimiAlibabaDeepSeekMetaSpaceXAIMistralAndre

Riktig, feil og avståelse i de nyeste modellene

Claude Opus 4.8 (max)indeks +27,4
riktig 46,6 %feil 19,2 %avstått 34,2 %
Claude Fable 5 (with fallback)indeks +40,2
riktig 61,4 %feil 21,2 %avstått 17,4 %
GPT-5.6 Sol (max)indeks +21,7
riktig 58,5 %feil 36,8 %avstått 4,6 %
Kimi K3indeks +18,4
riktig 46,0 %feil 27,5 %avstått 26,5 %
Kimi K2.6 hadde 32,8 prosent accuracy og 39,3 prosent rå hallusinasjonsrate. Kimi K3 økte accuracy til 46,0 prosent, samtidig som den rå raten steg til 50,9 prosent. Forsøksrate og avståelse må med i tolkningen.
Omniscience Index er prosent korrekte svar minus prosent ukorrekte svar. Avståelse er nøytral. En rå hallusinasjonsrate kan stige når en modell forsøker å svare oftere, selv om accuracy øker. Derfor vises riktig, feil og avståelse samlet.Artificial Analysis AA-Omniscience

Derfor må grafen vise riktighet, feil og avståelse samlet. En pen, universell fallkurve for hallusinasjoner ville vært misvisende. Den faktiske utviklingen er mer interessant: De beste modellene leverer nå langt flere riktige enn feil svar.

Sykofanti kan trenes ned

For sykofanti finnes det ingen ren historisk serie som dekker hele markedet. Den ærlige grafen består derfor av to paneler.

ELEPHANT tester 11 modeller med samme oppsett. Resultatene varierer fra 15 til 68 prosent moral-sykofanti. Claude 3.7 Sonnet og Gemini 1.5 Flash ligger på 15 prosent. GPT‑5 ligger på 22. GPT‑4o ligger på 40. Flere Qwen-, DeepSeek-, Llama- og Mistral-modeller ligger over 60.

OpenAIs egen generasjonsserie viser et tydelig treningssignal med samme protokoll: GPT‑4o fikk 14,5 prosent. GPT‑5 main fikk 5,2. GPT‑5 thinking kom ned i 4,0.

To sammenlignbare paneler · lavere er bedre

Sykofanti varierer kraftig og kan trenes ned

A · ELEPHANT · 11 modeller

Moral-sykofanti i samme tverrleverandør-oppsett

Qwen-, DeepSeek- og GPT-5-resultatene er kun merket med familienavn i det åpne notebook-resultatet.

B · OpenAI · samme protokoll

Generasjonssignal fra GPT-4o til GPT-5

GPT-4o-oppdateringen i april 2025 ble mer ettergivende og måtte rulles tilbake. Hendelsen vises som metodebevis, uten et oppdiktet datapunkt.Les leverandørens postmortem
Artificial Analysis har ingen sammenlignbar historisk sykofantiserie. ELEPHANT-panelet er et tverrleverandør-snapshot med samme protokoll. OpenAI-panelet er en separat generasjonsserie med samme leverandørprotokoll. Modellene er derfor ikke slått sammen til én konstruert tidslinje.ELEPHANT-artikkelen · Åpent resultatrepo · OpenAI deployment-safety-evaluering

Tilbakerullingen av GPT‑4o i april 2025 viser at utviklingen kan gå feil vei. Leverandøren gjorde modellen for ettergivende og måtte trekke oppdateringen. Feilen ble oppdaget, målt og korrigert.

En kald KI-krig

USA har dominert toppen. Kina har tatt innpå raskt. Når flere inference-innstillinger slås sammen per modellfamilie, ligger Kimi K3 på tredjeplass. Den konkurrerer direkte med Fable 5-oppsettet, GPT‑5.6 Sol, Opus 4.8 og GPT‑5.5.

Dette handler om langt mer enn chatboter. Landene som trener de sterkeste modellene bygger kompetanse, datasett, regnekraft og teknologi resten av økonomien blir avhengig av.

Norge kaller prompting for modelltrening

Min erfaring er at altfor mye av det norske KI-markedet består av markdownfiler, prompts, RAG og orkestrering rundt utenlandske modeller. Det presenteres ofte som KI-utvikling. Noen omtaler det til og med som trening.

Wrappers og RAG kan skape verdi. De kan gi bedre arbeidsflyt, riktigere kontekst og nyttige produkter. Modellvektene forblir urørt.

Prompting gir instrukser ved brukstid. RAG henter informasjon inn i konteksten. Modelltrening oppdaterer parametrene. Finetuning, post-training og RL endrer selve modellen. En mappe med markdownfiler er fortsatt en mappe med markdownfiler.

Denne språkbruken gir investorer, kunder og offentlig sektor et feil bilde av hva Norge faktisk bygger.

Modellene utvikler seg i rekordfart. Norge henger etter. Politikerne må komme på banen.

Målet er praktisk verdi: kortere saksbehandlingstid i offentlig forvaltning, bedre støtte og effektivisering av team, turnusarbeid, regnskap, økonomi og administrative oppgaver. Norge trenger egen kompetanse på data, trening og modellvekter dersom vi skal eie vår egen utvikling.

Kilder og metode

Intelligence- og Omniscience-punkter, releasedatoer og rangeringer er hentet fra Artificial Analysis, lest 18. juli 2026. Punktene er plassert ved releasedato og følger metodikken publisert ved uttrekket. Sykofantidata kommer fra ELEPHANT og OpenAIs GPT‑5 deployment-safety-evaluering.