analyse · 18. juli 2026
Kritikken mot KI er billig
Tre grafer viser utviklingen gjennom flere år, hundrevis av modeller og en rekke leverandører.
Kritikken mot KI i Norge går i sirkel. Modellen smigrer. Modellen hallusinerer. Modellen er for dum. Dette er reelle problemer. De blir samtidig målt, trent på og redusert i et tempo den norske debatten knapt forholder seg til.
Tre grafer viser utviklingen. De dekker flere år, hundrevis av modeller og en rekke leverandører. Tallene gjør det vanskelig å hevde at problemene står stille.
Intelligensen øker ekstremt raskt
Den første grafen inneholder 563 modell- og innstillingspunkter fra 2022 til 2026. Modellene er plassert ved releasedato. Noen punkter er direkte evaluert. Resten er estimert etter samme publiserte metode.
GPT‑3.5 Turbo startet på 3,6 poeng. GPT‑4 nådde 7,0 i mars 2023. Claude 3 Opus fikk 11,8 året etter. Deretter kom reasoning-modellene. OpenAI o1 nådde 23,4. Claude 3.7 Sonnet fikk 27,1. o3 løftet nivået til 30,4. GPT‑5 high kom opp i 34,7. Gemini 3 Pro Preview high nådde 39,6.
I 2026 går kurven brattere. GPT‑5.4 xhigh fikk 51,4. Opus 4.7 max nådde 53,5. Opus 4.8 max fikk 55,7. GPT‑5.5 xhigh ligger på 54,8. GPT‑5.6 Sol max ligger på 58,9. Kimi K3 følger rett bak med 57,1.
Øverst ligger et Fable 5-oppsett på 59,9. Det bruker Adaptive Reasoning, Max Effort og Opus 4.8 som fallback. Punktet må derfor beskrives som et oppsett. GPT‑5.6 Sol vises også i flere rader fordi max, xhigh og high er ulike reasoning-innstillinger.
563 modell- og innstillingspunkter · høyere er bedre
Intelligence Index etter releasedato
563
punkter totalt
150
direkte evaluert
3,6 → 59,9
under fire år
Små, svake punkter er estimerte. Større punkter er direkte evaluert. Den gule linjen viser beste publiserte score blant modellene som var sluppet på hvert tidspunkt.
Toppen 18. juli 2026
Fable-resultatet bruker Adaptive Reasoning, Max Effort og Opus 4.8 som fallback. Når flere innstillinger slås sammen per modellfamilie, ligger Kimi K3 på tredjeplass.
På under fire år har nivået gått fra 3,6 til 59,9. Dagens topp består av Fable 5-oppsettet, GPT‑5.6 Sol og Kimi K3.
Modellene leverer langt flere riktige svar
Den andre grafen har 446 punkter fra 2023 til 2026. Her bruker vi Omniscience Index. Den regnes som prosent korrekte svar minus prosent ukorrekte svar. Avståelse er nøytral.
Mistral 7B lå på −64,8 i 2023. Claude 3 Haiku fikk −47,6. Llama 3.1 405B kom opp til −17,3. GPT‑4o fra november 2024 nådde −10,8. Claude 3.7 Sonnet passerte null med +0,3. Gemini 3.1 Pro Preview nådde +32,9. Fable 5-oppsettet ligger på +40,2.
De nyeste modellene viser også store forskjeller. Opus 4.7 max får +26,2. Opus 4.8 max får +27,4. GPT‑5.5 xhigh ligger på +20,1. GPT‑5.6 Sol max ligger på +21,7. Kimi K3 får +18,4.
Rå hallusinasjonsrate alene gir et skjevt bilde. Modeller som forsøker å svare på flere spørsmål kan få høyere rate, selv om antallet riktige svar øker kraftig. Kimi K2.6 hadde 32,8 prosent accuracy og 39,3 prosent rå hallusinasjonsrate. Kimi K3 økte accuracy til 46,0 prosent, samtidig som den rå raten steg til 50,9 prosent.
446 punkter · riktig minus feil
Omniscience Index etter releasedato
446
sammenlignbare punkter
−64,8
frontier i 2023
+40,2
frontier i 2026
Riktig, feil og avståelse i de nyeste modellene
Derfor må grafen vise riktighet, feil og avståelse samlet. En pen, universell fallkurve for hallusinasjoner ville vært misvisende. Den faktiske utviklingen er mer interessant: De beste modellene leverer nå langt flere riktige enn feil svar.
Sykofanti kan trenes ned
For sykofanti finnes det ingen ren historisk serie som dekker hele markedet. Den ærlige grafen består derfor av to paneler.
ELEPHANT tester 11 modeller med samme oppsett. Resultatene varierer fra 15 til 68 prosent moral-sykofanti. Claude 3.7 Sonnet og Gemini 1.5 Flash ligger på 15 prosent. GPT‑5 ligger på 22. GPT‑4o ligger på 40. Flere Qwen-, DeepSeek-, Llama- og Mistral-modeller ligger over 60.
OpenAIs egen generasjonsserie viser et tydelig treningssignal med samme protokoll: GPT‑4o fikk 14,5 prosent. GPT‑5 main fikk 5,2. GPT‑5 thinking kom ned i 4,0.
To sammenlignbare paneler · lavere er bedre
Sykofanti varierer kraftig og kan trenes ned
A · ELEPHANT · 11 modeller
Moral-sykofanti i samme tverrleverandør-oppsett
Qwen-, DeepSeek- og GPT-5-resultatene er kun merket med familienavn i det åpne notebook-resultatet.
B · OpenAI · samme protokoll
Generasjonssignal fra GPT-4o til GPT-5
Tilbakerullingen av GPT‑4o i april 2025 viser at utviklingen kan gå feil vei. Leverandøren gjorde modellen for ettergivende og måtte trekke oppdateringen. Feilen ble oppdaget, målt og korrigert.
En kald KI-krig
USA har dominert toppen. Kina har tatt innpå raskt. Når flere inference-innstillinger slås sammen per modellfamilie, ligger Kimi K3 på tredjeplass. Den konkurrerer direkte med Fable 5-oppsettet, GPT‑5.6 Sol, Opus 4.8 og GPT‑5.5.
Dette handler om langt mer enn chatboter. Landene som trener de sterkeste modellene bygger kompetanse, datasett, regnekraft og teknologi resten av økonomien blir avhengig av.
Norge kaller prompting for modelltrening
Min erfaring er at altfor mye av det norske KI-markedet består av markdownfiler, prompts, RAG og orkestrering rundt utenlandske modeller. Det presenteres ofte som KI-utvikling. Noen omtaler det til og med som trening.
Wrappers og RAG kan skape verdi. De kan gi bedre arbeidsflyt, riktigere kontekst og nyttige produkter. Modellvektene forblir urørt.
Prompting gir instrukser ved brukstid. RAG henter informasjon inn i konteksten. Modelltrening oppdaterer parametrene. Finetuning, post-training og RL endrer selve modellen. En mappe med markdownfiler er fortsatt en mappe med markdownfiler.
Denne språkbruken gir investorer, kunder og offentlig sektor et feil bilde av hva Norge faktisk bygger.
Modellene utvikler seg i rekordfart. Norge henger etter. Politikerne må komme på banen.
Målet er praktisk verdi: kortere saksbehandlingstid i offentlig forvaltning, bedre støtte og effektivisering av team, turnusarbeid, regnskap, økonomi og administrative oppgaver. Norge trenger egen kompetanse på data, trening og modellvekter dersom vi skal eie vår egen utvikling.
Kilder og metode
Intelligence- og Omniscience-punkter, releasedatoer og rangeringer er hentet fra Artificial Analysis, lest 18. juli 2026. Punktene er plassert ved releasedato og følger metodikken publisert ved uttrekket. Sykofantidata kommer fra ELEPHANT og OpenAIs GPT‑5 deployment-safety-evaluering.