upplyst.ai

AI förändrar vad som är värt att kunna

Modellkollen

Ett benchmarkresultat är ingen fast egenskap hos modellen. Det är utfallet av en viss mätmetod, en viss version, en viss konfiguration och en viss dag. Epoch rättade 42 procent av problemen i FrontierMath när version 2 släpptes den 12 juni 2026, och ARC Prize skriver själva att resultaten på deras community-lista är självrapporterade och overifierade. Därför står det positioner här och inga poäng, och siffrorna länkas till den som mätt dem.

Programmera

Kontrollerad 23 augusti 2026

Vilken modell ska skriva och laga kod?

  • LederClaude Opus 5AnthropicHögsta noteringen på SWE-bench Verified. På LMArenas kodningslista ligger däremot flera äldre Opus-versioner före den, vilket säger något om skillnaden mellan att laga ett fel och att vara trevlig att arbeta med.
  • NäraKimi K3 MaxMoonshotHögst placerade modellen utanför Anthropic i mänskliga preferenser på kodning.

De två listorna är inte överens, och det är själva poängen. SWE-bench mäter om felet blev lagat, LMArena mäter vad människor föredrog att arbeta med. Tvåan på SWE-bench, Claude Mythos 5, är dessutom inte allmänt tillgänglig: den får bara köras av utvalda organisationer som försvarar samhällskritisk infrastruktur.

SWE-bench

Mäter. Om modellen kan laga ett riktigt fel i ett riktigt kodförråd, mätt som andelen GitHub-ärenden där den producerade patchen får projektets egna tester att gå igenom.

Mäter inte. Om koden är begriplig, säker eller något en kollega hade godkänt. Ett godkänt test är inte samma sak som en bra lösning.

Att veta. Samma lista kan blanda olika agenter och ställningar runt modellen, så en hög siffra kan lika gärna vara ett bättre verktyg som en bättre modell. Det finns en vy som kör alla med samma enkla agent, och den är den som jämför modeller.

Aktuella resultat hos SWE-bench

Resonera

Kontrollerad 23 augusti 2026

Vilken modell klarar svåra flerstegsproblem?

  • LederGPT-5.6 SolOpenAIHögsta noteringen både på ARC-AGI-2 och på FrontierMath tier 4.
  • NäraClaude Opus 5AnthropicStrax efter på ARC-AGI-2.

Avläst via sammanställningar, inte direkt från ARC Prize och Epoch, eftersom deras egna listor inte gick att läsa maskinellt. Siffrorna bör därför kontrolleras mot källan innan de citeras vidare.

ARC-AGI

Mäter. Om modellen kan lösa mönsteruppgifter den aldrig sett, alltså komma på regeln själv i stället för att känna igen den.

Mäter inte. Allt som liknar vanligt arbete. Uppgifterna är avsiktligt konstruerade och en hög poäng säger lite om nytta i en vardaglig uppgift.

Att veta. Resultat på de semiprivata seten körs och verifieras av ARC Prize. Community-listan är självrapporterad och verifieras inte, vilket de skriver ut själva.

Aktuella resultat hos ARC-AGI

FrontierMath

Mäter. Matematik på forskarnivå, problem som tar en specialist timmar och som inte går att lösa genom att känna igen ett standardgrepp.

Mäter inte. Räkning och matematik som någon faktiskt använder i arbetet. Det här är taket, inte golvet.

Att veta. Epoch släppte version 2 den 12 juni 2026 med rättelser i 42 procent av problemen. Jämför inte resultat mellan versionerna.

Aktuella resultat hos FrontierMath

Skriva

Kontrollerad 23 augusti 2026

Vilken modell skriver text en människa vill läsa?

  • LederClaude Fable 5AnthropicEtta både totalt och på kreativt skrivande. Var avstängd i arton dagar i somras efter en amerikansk exportorder, och är tillgänglig igen sedan den 1 juli.
  • NäraGemini 3.7 FlashGoogleHögsta placeringen utanför Anthropic på kreativt skrivande.

Läst på LMArena, både totallistan och kategorin kreativt skrivande, som pekar åt samma håll här. Det gör de inte alltid, och totallistan är fel lista att läsa om frågan är specifik.

LMArena

Mäter. Vad människor faktiskt föredrar. Två svar ställs mot varandra utan att avsändaren syns, och rankningen byggs av rösterna.

Mäter inte. Om svaret är sant. En preferensröst mäter vilket svar som tilltalade, inte vilket som stämde, och välformulerat fel vinner ibland.

Att veta. Rankningen skiljer sig kraftigt mellan kategorier, så den som läser totallistan läser fel fråga. Datan publiceras under CC-BY och går att granska.

Aktuella resultat hos LMArena