Hoppa till innehåll
AI & automation29 juni 2026Uppdaterad 5 augusti 2026

Då vs nu: vad AI faktiskt klarar, och vad siffrorna inte säger

Priset rasade, förmågan exploderade, användningen växte. Allt tre stämmer. Men nästan varje siffra som citeras mäter modellen, inte vad ett företag faktiskt fick ut. Här är båda halvorna, med källorna kontrollerade mot originalet.

Hugo Hansson Lindberg och Leo Segerdahl5 min läsning

Tre saker hände samtidigt de senaste åren: priset rasade, förmågan tog ett stort kliv, och användningen spred sig. Allt tre är sant och går att belägga. Problemet är att nästan varje siffra som citeras om det här mäter vad en modell presterar på ett prov, inte vad ett företag fick ut av att använda den. Skillnaden är hela poängen, och vi tänker inte dölja den.

Priset på en fast nivå av intelligens kollapsade

280x
Branschrapport
billigare blev det att köra ett system på GPT-3.5-nivå mellan november 2022 och oktober 2024, från 20 till 0,07 dollar per miljon tokens. GPT-3.5-nivå betyder här den billigaste modellen som når minst 64,8 på kunskapsprovet MMLU.

Källa: Artificial Intelligence Index Report 2025

Det är en verklig och stor förändring. Men den mäter priset på 2022 års förmåga, inte på något ni skulle bygga en agent på idag. Och den är ett enda urval ur en mycket bred fördelning.

Praktiskt betyder det att pris per token och kostnad per färdigt jobb har gått isär. Ingen bör räkna hem en automation på antagandet att inferensen fortsätter bli billigare. Det som gör kalkylen är att arbetet den ersätter kostar mer varje år.

Förmågan tog ett stort kliv, och mätstickan böjdes

På tekniska riktmärken har utvecklingen varit dramatisk. Stanfords AI Index 2026 rapporterar att prestandan på kodningstestet SWE-bench Verified steg från 60 till nära 100 procent på ett enda år. Men samma rapport, i samma utgåva, varnar för att riktmärkena själva blivit opålitliga.

2 till 42 %
Branschrapport
av frågorna i vanligt använda riktmärken är ogiltiga, enligt en genomgång som AI Index 2026 själva citerar. Ett test som mättas mot 100 procent är precis vad den varningen säger att man ska tvivla på.

Källa: Artificial Intelligence Index Report 2026, Technical Performance

En granskning av SWE-bench visade varför. Av de uppgifter en ledande AI-agent löste hade 32,67 procent lösningen skriven i uppgiftstexten, och 31,08 procent gick igenom på testfall som var för svaga för att upptäcka en felaktig lösning. När båda filtrerades bort föll agentens resultat från 12,47 till 3,97 procent.

65 %
Branschrapport
rätt når experter med doktorsexamen inom sitt eget ämne på GPQA, det prov som brukar kallas naturvetenskap på doktorandnivå. Dagens modeller slår den nivån. Provet består av 448 flervalsfrågor, vilket inte är samma sak som att göra en forskares arbete.

Källa: GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Den läser mer, men inte lika bra som den läser lite

2 048 → 1 000 000
Företagets egna siffror
tokens ryms i en modells minne på en gång, från GPT-3-artikeln 2020 till flera av dagens modeller. Ett helt avtal eller en lång anbudshandling får plats i ett svep.

Källa: Context windows (utvecklardokumentation)

Men leverantörens egen dokumentation säger emot den enkla tolkningen. Anthropic skriver rakt ut att mer sammanhang inte automatiskt är bättre, och att träffsäkerhet och minne försämras när antalet tokens växer. Ett fönster på en miljon tokens är ett tak, inte en arbetskapacitet. Långa dokument kräver därför uppslagning och kontroll, inte bara ett större fönster.

Så många svenska företag har faktiskt börjat

35,0 %
Officiell statistik
av svenska företag med minst 10 anställda använde någon AI-teknik i januari 2025, upp från 10,4 procent 2023. Bland företag med 10 till 49 anställda var siffran 30,7 procent.

Källa: It-användning i företag 2025: stor ökning av AI-användningen

Att säga till en tjugomannafirma i Göteborg att 72 procent av företagen redan gör det här är fel med en faktor två för hans egen jämförelsegrupp, och han vet om det. Den lägre siffran är dessutom det bättre argumentet: två tredjedelar av branschkollegorna har fortfarande inte börjat.

Utvecklingen saktar inte ner, och ni behöver inte följa varje ny modell. Ni behöver en agent som använder det bästa som finns, kopplad till hur just ni jobbar, och ett sätt att se om den faktiskt gör skillnad.

Källor

Varje siffra går att följa till primärkällan nedan. Vi skriver också ut vad källan faktiskt mäter och var den är svag, eftersom det avgör hur mycket den tål att luta sig mot.

  1. Artificial Intelligence Index Report 2025

    Stanford HAI · 2025

    Branschrapport

    Rapporten anger 280-faldigt prisfall men definierar aldrig vad GPT-3.5-nivå betyder. Tröskeln MMLU 64,8 och prisserien 20 till 0,07 dollar kommer från underlaget hos Epoch AI. Fönstret slutar i oktober 2024.

  2. Artificial Intelligence Index Report 2026, Technical Performance

    Stanford HAI · 2026

    Branschrapport

    Rapporten anger varken startdatum, modellnamn eller testupplägg för språnget från 60 till nära 100 procent, så jämförelsen går inte att förankra i tid.

  3. LLM inference prices have fallen rapidly but unequally across tasks

    Epoch AI · 2025

    Branschrapport

    Bygger på listpriser för den billigaste modellen som klarar en tröskel, alltså leverantörernas prissättning snarare än faktisk kostnad. Epoch skriver själva att de snabbaste prisfallen är färska och kanske inte håller i sig.

  4. The Price of Progress: Price Performance and the Future of AI

    Gundlach, Lynch, Mertens & Thompson, arXiv:2511.23455 · 2026

    Branschrapport

    Förhandspublicering utan bekräftad kollegial granskning. Prisdatan är hämtad från Artificial Analysis och Epoch AI och ärver deras listprisbegränsning.

  5. SWE-Bench+: Enhanced Coding Benchmark for LLMs

    Aleithan m.fl., arXiv:2410.06992 · 2024

    Branschrapport

    Granskningen omfattar de uppgifter som SWE-Agent med GPT-4 löste, inte hela riktmärket eller andra agenter.

  6. GPQA: A Graduate-Level Google-Proof Q&A Benchmark

    Rein m.fl., arXiv:2311.12022 · 2023

    Branschrapport

    448 flervalsfrågor. De 65 procenten gäller experter med doktorsexamen inom samma ämne som frågan, under tidspress. Skickliga icke-experter med fri webbåtkomst nådde 34 procent.

  7. Context windows (utvecklardokumentation)

    Anthropic · 2026

    Företagets egna siffror

    Leverantörens egen dokumentation, läst 5 augusti 2026. Miljonfönstret gäller ett urval av modellerna, inte alla. Jämförelsetalet 2 048 tokens kommer från GPT-3-artikeln, inte härifrån.

  8. Language Models are Few-Shot Learners (GPT-3)

    Brown m.fl., arXiv:2005.14165 · 2020

    Peer-review

    Artikeln anger att samtliga modeller använder ett kontextfönster på 2 048 tokens.

  9. It-användning i företag 2025: stor ökning av AI-användningen

    Statistiska centralbyrån · 2025

    Officiell statistik

    Stratifierat slumpurval på 4 800 företag med minst 10 anställda, 80 procents svarsfrekvens, referensmånad januari 2025. Storleksfördelningen med en decimal kommer från Eurostat, SCB publicerar den bara i heltal. SCB dokumenterar ett tidsseriebrott 2023, så äldre år är inte jämförbara.

  10. 20 % av EU:s företag använder AI-teknik

    Eurostat · 2025

    Officiell statistik

    Samma undersökning som SCB:s, harmoniserad över EU. Indikatorn breddades 2025 med teknik som genererar bild, video eller ljud, vilket gör jämförelser bakåt osäkra.

  11. The State of AI

    McKinsey & Company · 2025

    Enkät

    Självvald webbpanel, knappt 2 000 svarande, 38 procent från bolag över en miljard dollar i omsättning. Enheten är svarande, inte företag. Citeras här som jämförelse, inte som underlag.