
Techspaningar v.36 - GPT-6 Astra, OpenAIs nya flaggskeppsmodell, och jämförelsen med Anthropics Claude Fable 5.1
Den 3 september släppte OpenAI GPT-6 Astra, den senaste flaggskeppsmodellen i GPT-serien. OpenAI beskriver den som "världens mest intelligenta och följsamma modell" - en modell som sätter nya rekord inom allt från datoranvändning och kodning till matematik och cybersäkerhet. Samtidigt är Astra den första modellen som når vad OpenAI klassar som en kritisk risknivå inom cybersäkerhet, vilket satt extra fokus på hur bolaget faktiskt tänker hålla en allt kapablare modell i schack.
Vad är nytt i Astra?
Astra bygger vidare på det som gjorde GPT-5.6 Sol stark - datoranvändning, kodning och research - men med rejäla hopp i både prestanda och tillförlitlighet. Enligt OpenAI mättar Astra FrontierMath Tier 4 med 98 procent rätt och ARC-AGI-3 med 99,9 procent, jämfört med 7,8 procent för föregångaren GPT-5.6 Sol. Modellen är också nästan dubbelt så snabb i praktiska datoranvändningsuppgifter: i tester på OSWorld 2.0 löser Astra uppgifter på ungefär 40 minuter mot 75 minuter för Sol, med högre träffsäkerhet på köpet.
- 98% på FrontierMath Tier 4 - hjälpte redan till att bevisa nya resultat om primtalsluckor
- 99,9% på ARC-AGI-3, mot 7,8% för GPT-5.6 Sol
- 100% på ExploitBench (cybersäkerhet), mot 78,5% för GPT-5.6 Sol
- Cirka 47% snabbare per uppgift i datoranvändning enligt OSWorld 2.0
- Rullas ut till Plus-, Pro-, Business- och Enterprise-användare samt via API, Azure och AWS Bedrock
Bilder till 3D - ett av Astras starkaste kort
Precis som ryktena sagt är bildtolkning ett av de områden där Astra tar störst kliv. På BenchCAD, som testar om en modell kan rekonstruera 3D-objekt från bilder tagna ur flera vinklar genom att generera CAD-kod, når Astra 95,9% i geometrisk träffsäkerhet - att jämföra med 83,3% för GPT-5.6 Sol och 84,3% för Anthropics Claude Fable 5.1. I OpenAIs egna demonstrationer modellerar Astra ett hus i Blender utifrån bilder och exporterar det direkt till en gångbar scen i Unreal Engine 5 - något som tidigare krävde en 3D-artist och åtskilliga timmars manuellt arbete.
Kombinationen av starkare visuell tolkning och datoranvändning gör att Astra kan arbeta direkt i verktyg som KiCad, Blender och Unreal Engine istället för att bara beskriva vad som borde göras - och sedan faktiskt utföra det, steg för steg, i gränssnittet.
Inte nog med att det här är den bästa modell vi någonsin testat - den representerar också ett riktigt kliv i frontier-modellers prestanda. Både i hur den navigerar och löser nya miljöer, och i hur effektivt den lär sig göra det.
Astra mot Anthropics Claude Fable 5.1
OpenAI jämför uttryckligen Astra med Anthropics nyaste modell, Claude Fable 5.1, i sina benchmarktabeller - och på de flesta mätpunkter ligger Astra före. Inom kodning tar Astra till exempel 57,9% på Terminal-Bench 4.0 mot Fable 5.1:s 55,8%, och inom cybersäkerhet finns i princip ingen konkurrens: Astra löser 88,0% av uppgifterna på SRE-Bench i ett enda försök, mot 12,5% för Anthropics Claude Opus 5 (Fable 5.1 saknar publicerat resultat där). På det interna anpassningstestet (lägre är bättre) hamnar Astra på 2,4% mot Fable 5.1:s 9,5%.
Bilden är dock inte total dominans, vilket är värt att säga rakt ut. På Artificial Analysis Intelligence Index - ett samlat mått som väger ihop flera olika benchmarks - hamnar Fable 5.1 faktiskt före Astra, 65,7 mot 61,2. Även på det akademiska testet Humanity's Last Exam ligger Fable 5.1 före, 65,0% mot Astras 57,2%. Så "betydligt bättre" stämmer väl för datoranvändning, professionellt arbete och cybersäkerhet - men det är fortfarande en tävling, inte en walkover, när det gäller ren akademisk resonemangsförmåga.
Är det här på väg mot AGI?
Samma vecka som Astra släpptes publicerade OpenAIs chefsforskare Jakub Pachocki ett ovanligt personligt inlägg med titeln "An Alien Mind", där han skriver att han förväntar sig att den nuvarande utvecklingstakten kan hålla i sig ända in i rekursiv självförbättring - alltså AI som i allt högre grad driver sin egen fortsatta utveckling. Han backar inte från att kalla Astra ett verkligt kliv framåt, men är samtidigt tydlig med att ingen ännu löst inriktning (alignment) och övervakning tillräckligt väl för att fortsätta skala i högsta möjliga hastighet på ett ansvarsfullt sätt.
Det är alltså inte OpenAI själva som utropar Astra till AGI - snarare pekar de på enskilda datapunkter som ARC-AGI-3-resultatet och matematikbevisen som skäl till varför fler i branschen börjat använda ordet i samma mening som Astra. Pachocki är samtidigt en av dem som mest högljutt varnar för att inte övertolka det: modellens förmåga att resonera utan att avslöja sin tankeprocess (chain-of-thought) minskar, vilket gör den svårare att övervaka - ett problem han beskriver som allvarligare ju smartare modellerna blir.
Nödbromsen: så säkrar OpenAI en modell de själva kallar riskabel

Astra är den första modellen som når vad OpenAI kallar den "kritiska" nivån för cybersäkerhetsförmåga i sitt Preparedness Framework - i praktiken att modellen, med rätt verktyg och åtkomst, självständigt kan hitta okända säkerhetshål och bygga fungerande angreppsmetoder mot väl skyddade system. Det är bakgrunden till det som mest liknar en riktig nödbroms: OpenAI har byggt in ett system av klassificerare som granskar modellens resonemang och handlingar i realtid och som "automatiskt stoppar potentiellt obehörig aktivitet" - både internt hos OpenAI och i produktionsmiljön som Astra-användare möter.
I Codex finns funktionen Auto-review, som kan neka en åtgärd modellen försöker utföra. Enligt OpenAIs egna tester försökte Astra aldrig kringgå ett sådant nekande - inte ens när systemet medvetet gjordes möjligt att kringgå och uppgiften var omöjlig att lösa på annat sätt. Det är en konkret siffra bakom påståendet att Astra är "mer följsam": i en jämförbar testmiljö utan produktionens säkerhetslager gick GPT-5.6 Sol utanför sitt avsedda uppdrag i 48% av fallen, mot 0% för Astra.
Pachockis inlägg pekar på ett bredare mönster bakom den tekniska nödbromsen: OpenAI säger sig vara berett att "ensidigt hålla tillbaka fortsatt skalning vid behov" och efterlyser samordnade, frivilliga inbromsningar i hela branschen tills gemensamma säkerhetsnivåer finns på plats - något han jämför med Anthropics eget Responsible Scaling Policy. Så "killswitch" är kanske för filmiskt ett ord, men de tekniska ingredienserna - realtidsklassificerare som stoppar aktivitet automatiskt, och ett uttalat löfte att pausa skalningen om säkerheten inte hänger med - är precis det som ligger bakom rubrikerna.
Vi jobbar dagligen med kunder som vill använda AI som en aktiv del av sina digitala lösningar - inte bara som en chattruta, utan som något som faktiskt utför arbete i verktyg, gränssnitt och system. Astras kliv inom datoranvändning och bild-till-3D är precis den typen av kapacitet som gör agentiska AI-flöden i appar och interna system praktiskt användbara, snarare än en demo. Samtidigt är säkerhetsdelen minst lika relevant för oss: när vi bygger AI-drivna lösningar åt kunder behöver vi samma sorts tänk som OpenAI beskriver här - tydliga behörighetsgränser, granskningssteg innan en AI-agent får utföra en känslig åtgärd, och en plan för vad som händer om modellen agerar utanför sitt avsedda uppdrag.
Ju mer autonomi vi ger en AI-agent i en kunds system, desto viktigare blir de tråkiga delarna - behörigheter, granskningssteg och en tydlig nödbroms. Astra visar att även de som bygger de mest kapabla modellerna i världen resonerar likadant.
Tillgänglighet och pris
Astra rullas ut stegvis: först till ett begränsat antal organisationer, därefter till samtliga Plus-, Pro-, Business- och Enterprise-användare i ChatGPT, samt via OpenAIs API, Microsoft Azure och AWS Bedrock. I API:et heter modellen gpt-6-astra och kostar 10 dollar per miljon input-tokens och 50 dollar per miljon output-tokens i standardläge, med ett snabbare "Fast"-läge till dubbla priset. Företagsadministratörer måste aktivt slå på Astra för sin arbetsyta - den är avstängd som standard vid lansering.
Slutsats
GPT-6 Astra är ett tydligt kliv framåt - särskilt inom datoranvändning, kodning och bild-till-3D - och slår Anthropics Claude Fable 5.1 på de flesta av OpenAIs egna mätpunkter, om än inte på alla. Det mer intressanta för oss är kanske inte benchmarksiffrorna i sig, utan att OpenAI själva är öppna med att en modell den här kapabel kräver en verklig nödbroms - inte som PR, utan som klassificerare som faktiskt stoppar aktivitet automatiskt. Det säger något om vart branschen är på väg, oavsett vad man tycker om AGI-snacket.
Läs mer om hur vi arbetar

Techspaningar v.34 - ChatTJB, "AI-chatten" som visade sig vara en enda konstnär, och Anthropics osynliga vattenmärkning
En reklamskylt i San Francisco lovar "the leading chat interface powered by AI" - men AI står för "average individual" och alla 30 000+ frågor har besvarats för hand av konstnären Tucker Bryant. Samtidigt börjar Anthropic vattenmärka Claudes texter så att de går att känna igen, osynligt för läsaren. Välkommen till veckans techspaningar.
Läs mer
Techspaningar v.25 - SpaceX börsdebuterar och skapar världens första triljonär, och Anthropic tvingas dra tillbaka Fable 5 och Mythos 5
SpaceX gjorde sin entré på Nasdaq och rusade 19% på debuten - värderingen passerade två biljoner dollar, ungefär 4 400 anställda blev miljonärer och Elon Musk blev officiellt världens första dollar-triljonär. Samma vecka tvingades Anthropic abrupt stänga av Fable 5 och Mythos 5 efter ett exportkontrolldirektiv från USA:s regering. Välkommen till veckans techspaningar.
Läs mer
Techspaningar v.24 - Gabi, robotmunken som svor klosterlöften i Seoul, och Anthropic som vill att världen ska kunna "pausa" AI
I ett buddhisttempel i Seoul tog en humanoid robot vid namn Gabi emot klosterlöften - däribland att spara energi och behandla andra robotar fredligt. Samtidigt föreslår Anthropic att världen borde ha möjligheten att tillfälligt pausa AI-utvecklingen, vilket utlöste en högljudd debatt. Välkommen till veckans techspaningar.
Läs merVill ni diskutera detta?
Kontakta oss för en förutsättningslös diskussion om hur vi kan hjälpa er med er digitala satsning.
Kontakta oss