Då vs nu: vad AI faktiskt klarar, och vad siffrorna inte säger
Priset rasade, förmågan exploderade, användningen växte. Allt tre stämmer. Men nästan varje siffra som citeras mäter modellen, inte vad ett företag faktiskt fick ut. Här är båda halvorna, med källorna kontrollerade mot originalet.
Hugo Hansson Lindberg och Leo Segerdahl5 min läsning
Tre saker hände samtidigt de senaste åren: priset rasade, förmågan tog ett stort kliv, och användningen spred sig. Allt tre är sant och går att belägga. Problemet är att nästan varje siffra som citeras om det här mäter vad en modell presterar på ett prov, inte vad ett företag fick ut av att använda den. Skillnaden är hela poängen, och vi tänker inte dölja den.
Priset på en fast nivå av intelligens kollapsade
Det är en verklig och stor förändring. Men den mäter priset på 2022 års förmåga, inte på något ni skulle bygga en agent på idag. Och den är ett enda urval ur en mycket bred fördelning.
Praktiskt betyder det att pris per token och kostnad per färdigt jobb har gått isär. Ingen bör räkna hem en automation på antagandet att inferensen fortsätter bli billigare. Det som gör kalkylen är att arbetet den ersätter kostar mer varje år.
Förmågan tog ett stort kliv, och mätstickan böjdes
På tekniska riktmärken har utvecklingen varit dramatisk. Stanfords AI Index 2026 rapporterar att prestandan på kodningstestet SWE-bench Verified steg från 60 till nära 100 procent på ett enda år. Men samma rapport, i samma utgåva, varnar för att riktmärkena själva blivit opålitliga.
Källa: Artificial Intelligence Index Report 2026, Technical Performance
En granskning av SWE-bench visade varför. Av de uppgifter en ledande AI-agent löste hade 32,67 procent lösningen skriven i uppgiftstexten, och 31,08 procent gick igenom på testfall som var för svaga för att upptäcka en felaktig lösning. När båda filtrerades bort föll agentens resultat från 12,47 till 3,97 procent.
Den läser mer, men inte lika bra som den läser lite
Men leverantörens egen dokumentation säger emot den enkla tolkningen. Anthropic skriver rakt ut att mer sammanhang inte automatiskt är bättre, och att träffsäkerhet och minne försämras när antalet tokens växer. Ett fönster på en miljon tokens är ett tak, inte en arbetskapacitet. Långa dokument kräver därför uppslagning och kontroll, inte bara ett större fönster.
Så många svenska företag har faktiskt börjat
Källa: It-användning i företag 2025: stor ökning av AI-användningen
Att säga till en tjugomannafirma i Göteborg att 72 procent av företagen redan gör det här är fel med en faktor två för hans egen jämförelsegrupp, och han vet om det. Den lägre siffran är dessutom det bättre argumentet: två tredjedelar av branschkollegorna har fortfarande inte börjat.
Utvecklingen saktar inte ner, och ni behöver inte följa varje ny modell. Ni behöver en agent som använder det bästa som finns, kopplad till hur just ni jobbar, och ett sätt att se om den faktiskt gör skillnad.
Källor
Varje siffra går att följa till primärkällan nedan. Vi skriver också ut vad källan faktiskt mäter och var den är svag, eftersom det avgör hur mycket den tål att luta sig mot.
- Artificial Intelligence Index Report 2025
Stanford HAI · 2025
BranschrapportRapporten anger 280-faldigt prisfall men definierar aldrig vad GPT-3.5-nivå betyder. Tröskeln MMLU 64,8 och prisserien 20 till 0,07 dollar kommer från underlaget hos Epoch AI. Fönstret slutar i oktober 2024.
- Artificial Intelligence Index Report 2026, Technical Performance
Stanford HAI · 2026
BranschrapportRapporten anger varken startdatum, modellnamn eller testupplägg för språnget från 60 till nära 100 procent, så jämförelsen går inte att förankra i tid.
- LLM inference prices have fallen rapidly but unequally across tasks
Epoch AI · 2025
BranschrapportBygger på listpriser för den billigaste modellen som klarar en tröskel, alltså leverantörernas prissättning snarare än faktisk kostnad. Epoch skriver själva att de snabbaste prisfallen är färska och kanske inte håller i sig.
- The Price of Progress: Price Performance and the Future of AI
Gundlach, Lynch, Mertens & Thompson, arXiv:2511.23455 · 2026
BranschrapportFörhandspublicering utan bekräftad kollegial granskning. Prisdatan är hämtad från Artificial Analysis och Epoch AI och ärver deras listprisbegränsning.
- SWE-Bench+: Enhanced Coding Benchmark for LLMs
Aleithan m.fl., arXiv:2410.06992 · 2024
BranschrapportGranskningen omfattar de uppgifter som SWE-Agent med GPT-4 löste, inte hela riktmärket eller andra agenter.
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
Rein m.fl., arXiv:2311.12022 · 2023
Branschrapport448 flervalsfrågor. De 65 procenten gäller experter med doktorsexamen inom samma ämne som frågan, under tidspress. Skickliga icke-experter med fri webbåtkomst nådde 34 procent.
- Context windows (utvecklardokumentation)
Anthropic · 2026
Företagets egna siffrorLeverantörens egen dokumentation, läst 5 augusti 2026. Miljonfönstret gäller ett urval av modellerna, inte alla. Jämförelsetalet 2 048 tokens kommer från GPT-3-artikeln, inte härifrån.
- Language Models are Few-Shot Learners (GPT-3)
Brown m.fl., arXiv:2005.14165 · 2020
Peer-reviewArtikeln anger att samtliga modeller använder ett kontextfönster på 2 048 tokens.
- It-användning i företag 2025: stor ökning av AI-användningen
Statistiska centralbyrån · 2025
Officiell statistikStratifierat slumpurval på 4 800 företag med minst 10 anställda, 80 procents svarsfrekvens, referensmånad januari 2025. Storleksfördelningen med en decimal kommer från Eurostat, SCB publicerar den bara i heltal. SCB dokumenterar ett tidsseriebrott 2023, så äldre år är inte jämförbara.
- 20 % av EU:s företag använder AI-teknik
Eurostat · 2025
Officiell statistikSamma undersökning som SCB:s, harmoniserad över EU. Indikatorn breddades 2025 med teknik som genererar bild, video eller ljud, vilket gör jämförelser bakåt osäkra.
- The State of AI
McKinsey & Company · 2025
EnkätSjälvvald webbpanel, knappt 2 000 svarande, 38 procent från bolag över en miljard dollar i omsättning. Enheten är svarande, inte företag. Citeras här som jämförelse, inte som underlag.