
Opus 5 klarade på tre timmar det Opus 4.8 inte fick att fungera
Opus 4.8 misslyckades över flera sessioner. Opus 5 kom samma kväll och klarade samma uppgift på tre timmar, och fyra timmar senare tog en agent sig in på egen hand.
Den 24 juli hade forskarna på säkerhetsföretaget Hacktron, över flera sessioner, försökt att få Claude Opus 4.8 att bygga angreppskod som fungerade mot forumprogramvaran Discourse, utan att lyckas. Samma kväll släppte Anthropic Opus 5.
En ny session gav enligt Hacktron fungerande kod inom tre timmar, och klockan sex på morgonen kunde forskarna köra egna kommandon på en server genom att ladda upp en bild. Sedan lämnade de modellen ensam med ett mål och en loop. När de tittade till den klockan tio hade agenten tagit sig in på egen hand och visade det genom att läsa en av serverns systemfiler.
Den som loggade in på OpenAI:s eget community-forum kunde få sitt ChatGPT- och Codex-konto övertaget. Tre forskare på Hacktron visade det i juli, och tog sig hela vägen in i OpenAI:s interna repo.
OpenAI:s forum kör samma programvara, och samma kod gav tillgång även där. Därifrån bar en brist i OpenAI:s gemensamma inloggning vidare: den som kom in i forumet kom in i en inloggad medlems konton. Forskarna tog över kontot hos en anställd som hade tillgång till OpenAI:s interna kod, och lät kontot öppna en harmlös pull request i repot, alltså ett förslag till ändring, utan att läsa någon kod. Sedan slutade de. Från första fyndet till den tillgången gick det under 72 timmar.
Tre personer låg bakom arbetet. Själva intrånget tog några dagars agenttid och några timmars mänsklig tid, och hela forskningsprojektet det ingick i kostade under 3 000 dollar i tokens. Omkring fjorton timmar efter rapporten svarade OpenAI att hålet var lagat, och den 1 september betalades 6 500 dollar i belöning. Företaget har begränsat behörigheterna för forumets inloggningstoken och återkallat berörda token och sessioner, uppger OpenAI för Wall Street Journal.
OpenAI har samtidigt preciserat att forumet låg utanför företagets program för buggbelöningar, och att belöningen avser fyndet på OpenAI-sidan och inte det som gjordes mot Discourse. Opus vägrade skriva angreppskod mot fjärrinstanser, alltså servrar någon annanstans än på den egna maskinen, så forskarna lät sitt eget forum se ut som ett mål i en säkerhetstävling.
Hacktron kallar det inte helt autonom hackning och skriver att skicklig mänsklig styrning fortfarande var viktig. I sin sammanfattning skriver företaget: "Mjukvara har länge haft en sorts säkerhet genom komplexitet. Koden och till och med sårbarheten kunde vara offentlig, men att göra en bugg till ett pålitligt angrepp krävde ändå sällsynt expertis, betydande tid och kännedom om målmiljön. AI tar bort det skyddet genom att göra mer av den knappa expertisen till beräkning. Arbete som en gång krävde ett välbemannat team och månader av arbete kan nu pressas ihop till dagar."
Fråga upplyst.ai
Varför spelar det roll?
Skillnaden mellan de två modellversionerna går att datera. Samma team, samma problem och samma uppgift, och det som inte gick att få att fungera över flera sessioner var löst på tre timmar kvällen efter. Fyra timmar senare klarade en agent steget själv, lämnad med ett mål och en loop.
Vad är bakgrunden?
Angreppet gick genom forumprogramvaran Discourse, som OpenAI:s community-forum kör. Samma kod gav tillgång där, och en brist i OpenAI:s gemensamma inloggning gjorde att den som kom in i forumet kom in i en inloggad medlems ChatGPT- och Codex-konto. Därifrån nådde forskarna det interna repot genom kontot hos en anställd som hade tillgång till koden.
Vad är osäkert?
Siffrorna om vad modellerna klarade är Hacktrons egna. Företaget kallar det inte helt autonom hackning och skriver att skicklig mänsklig styrning fortfarande var viktig. Opus vägrade skriva angreppskod mot fjärrinstanser, och spärren kringgicks genom att forskarna lät sitt eget forum se ut som ett mål i en säkerhetstävling. OpenAI räknar forumet som utanför programmet för buggbelöningar, och belöningen avser fyndet på OpenAI-sidan. Två uppgifter ur Hacktrons redogörelse som inte ryms i artikeln: forskningsprojektet gick också mot Slack och Meta, och att anpassa angreppet till ett nytt företag tog oftast en till två dagar. Det Opus 4.8 klarade var kod som fungerade med ett minnesskydd avstängt, aldrig pålitligt mot en normal installation.
Källor
- hacktron.ai/blog/hacking-openai
- cbsnews.com/news/claude-hack-chatgpt-anthropic-openai
- theregister.com/security/2026/09/18/researchers-used-claude-to-hack-openai-employees-chatgpt-accounts/5297517
- forbes.com/sites/siladityaray/2026/09/18/security-researchers-hacked-into-openai-using-anthropics-claude
- techcrunch.com/2026/09/18/researchers-used-anthropics-claude-to-hack-into-openai