Loading blog posts...
Loading blog posts...
Laden...

GPT-6 Astra is AGI volgens een praktische, operationele definitie. Het systeem kan een breed geformuleerd doel oppakken, gangbare software bedienen, resultaten controleren, fouten herstellen en nuttig werk afronden in uiteenlopende vakgebieden. Het sterkste bewijs is geen benchmarkscore. Het is de gesloten werkcyclus.
Gebruik deze vijfdelige test in plaats van te discussiëren over bewustzijn:
| Vermogen | Praktische test | Te controleren bewijs |
|---|---|---|
| Doelinterpretatie | Een gewenst resultaat accepteren in plaats van gedetailleerde instructies | Plant het systeem tussenstappen? |
| Toolgebruik | Browsers, terminals, bestanden en professionele software bedienen | Kan het tussen applicaties schakelen? |
| Resultaatcontrole | Visuele en functionele uitvoer controleren | Merkt het defecte lay-outs of mislukte acties op? |
| Foutherstel | Na een fout een andere aanpak kiezen | Kan het zonder menselijke correctie doorgaan? |
| Afronding | Een bruikbaar eindproduct opleveren | Is het resultaat klaar voor beoordeling of uitrol? |
Een chatbot die uitlegt hoe u een CRM-record bijwerkt, slaagt niet voor deze test. Een systeem dat inlogt, het account opzoekt, het record bijwerkt, de opgeslagen waarde controleert en meldt dat de taak is afgerond, slaagt wel.
OpenAI-president Greg Brockman zou deze periode hebben omschreven als het begin van het AGI-tijdperk. Die uitspraak weegt minder zwaar dan waarneembaar gedrag. De terminologie van een bedrijf kan geen uitsluitsel geven over een omstreden technische en filosofische categorie.
Volgens de operationele test is GPT-6 Astra AGI een verdedigbare kwalificatie. De gedocumenteerde mogelijkheden omvatten beeldinvoer, toolgebruik, computerbediening en reasoning-instellingen van low tot max, aldus de officiële modeldocumentatie van GPT-6 Astra. Het model heeft een contextvenster van 1.050.000 tokens, een uitvoerlimiet van 128.000 tokens en een kennisgrens van 30 april 2026. Die limieten maken werk mogelijk met broncoderepository's, onderzoeksmateriaal, screenshots, bedrijfsbestanden en lange uitvoeringsgeschiedenissen.
Note
Operationele AGI impliceert geen bewustzijn, feilloos beoordelingsvermogen, onbeperkte autonomie of gelijkwaardige prestaties bij elke taak. De term beschrijft een drempel voor algemeen, doelgericht werk.
Waarom dit belangrijk is: AGI wordt toetsbaar wanneer succes draait om afgerond werk, niet om overtuigende gesprekken.
GPT-6 Astra behaalde naar verluidt 62,7% op ARC-AGI-3 met de standaardharness en het maximale inspanningsniveau. Met de Provider Adapter-harness steeg het resultaat tot 98,6%, volgens de Astra-evaluatie van ARC Prize.
ARC-AGI-3 test verkenning en aanpassing in onbekende interactieve omgevingen. Een model moet verborgen regels afleiden uit feedback, in plaats van bekende antwoordpatronen op te halen.
Het verschil van 35,9 procentpunt is geen voetnoot. De Provider Adapter kan reasoning en een compacte versie van de eerdere interactiegeschiedenis op een andere manier bewaren. Daardoor verandert welke informatie tijdens een lange taak beschikbaar blijft voor het model.
Bij agentevaluaties bestaat het geteste systeem uit het model plus het contextbeleid, geheugen, tools, de retrylogica en het observatieformaat. Beide uitvoeringen als dezelfde test behandelen, verhult een belangrijke technische realiteit: de orchestration kan bepalen of het model verward of competent overkomt.
HardBench en Terminal-Bench 4 worden eveneens als vergelijkingsbenchmarks genoemd. Hun scores zijn alleen betekenisvol wanneer de exacte benchmarkversie, omgeving, toolrechten, reasoning-inspanning, time-out en het retrybeleid bekend zijn.
Warning
Vergelijk benchmarkpercentages voor agents niet zonder de harness te controleren. Persistente status, verborgen retries, compaction en subagents kunnen een ander systeem opleveren, zelfs wanneer de modelnaam hetzelfde blijft.
Waarom dit belangrijk is: Astra's resultaten zijn indrukwekkend, maar het verschil tussen de harnesses bewijst dat AGI-evaluaties het volledige besturingssysteem rond het model moeten meten.

Neem een opdracht die meerdere applicaties omvat: onderzoek een bedrijf, verifieer de contactgegevens, werk het CRM-record bij, stel een relevante e-mail op en leg het resultaat vast. Astra kan naar verluidt websites doorlopen, formulieren invullen, schermen controleren, records bijwerken en over applicatiegrenzen heen doorgaan, zoals beschreven in de modelrichtlijnen voor GPT-6 Astra.
Het doorslaggevende gedrag vindt plaats ná een actie. Astra kan controleren of een formulier succesvol is verzonden, vaststellen dat software niet kon worden geïnstalleerd, het plan bijstellen en een andere route proberen. Die correctiecyclus maakt het verschil tussen tekst genereren en zelfstandig handelen.
Een geloofwaardige lijst met instructies produceren is eenvoudig. De status behouden terwijl de werkelijkheid onverwachte schermen, validatiefouten, ontbrekende afhankelijkheden en gedeeltelijke resultaten teruggeeft, is veel moeilijker.
Dezelfde cyclus geldt voor desktopwerk. Het model kan software installeren, een browser bedienen, bestanden controleren, problemen oplossen en daarna het oorspronkelijke doel hervatten. Menselijk toezicht verschuift daarmee van het aansturen van elke klik naar het bepalen van grenzen en het beoordelen van het eindresultaat.
De waardevolste evaluatiemaatstaf is daarom niet het aantal tokens per seconde. Het is het geverifieerde voltooiingspercentage: het aandeel taken dat eindigt met de vereiste toestand, bevestigd via een onafhankelijke controle.
Waarom dit belangrijk is: Een systeem dat zijn eigen fouten kan waarnemen en vervolgens verder werkt aan de afronding, heeft een betekenisvollere grens overschreden dan een systeem dat alleen betere antwoorden genereert.
Een gegenereerde kartracer zegt meer dan een gelikte screenshot. Het model moet invoer, beweging, botsingen, camera's, baanvormen, belichting, scores en feedback samenbrengen tot één interactief systeem.
Tot de gemelde Astra-demonstraties behoort een Minecraft-achtige kloon met shaders, itempictogrammen, boerderijen, belichting, animaties voor het breken van blokken en watergedrag. In een andere demonstratie bouwde Astra een stad in Unity, in plaats van slechts een statische visuele mock-up te produceren, aldus de officiële modelrichtlijnen.
Playbot-integraties met Unity en Godot maken de cyclus concreet. Het model kan een scène bewerken, de build uitvoeren, het resultaat controleren, fouten identificeren en assets of logica binnen de engine aanpassen.
Drie prototypes met piraten-, snoep- en cyberpunkthema zouden vanuit één grey-boxgame zijn gemaakt. De meeste werkten bij de eerste poging, met ongeveer 50% minder handmatige correcties dan bij het vorige model. Dit zijn door de leverancier gerapporteerde resultaten, dus de projectbestanden, acceptatiecriteria en vergelijkingsconfiguratie blijven van belang.
De Unreal Engine-case gaat nog een stap verder. Astra zou een grote wereld hebben gecreëerd, bevolkt door modelgestuurde personages die samenwerkten, overleefden en met elkaar spraken. Het bijbehorende verhaal over de stem in het appartement blijft een anekdote, geen gemeten bewijs.
Lees voor een diepere analyse van dit productiepatroon OpenAI Astra Turns One Prompt Into Finished 3D Work.
Waarom dit belangrijk is: Interactief 3D-werk test causaal, ruimtelijk, visueel en procedureel redeneervermogen binnen één taak. Daarmee levert het sterker bewijs dan beeldkwaliteit alleen.

Geef Astra een map met spreadsheets, referentiedocumenten, merkbestanden en presentatievereisten. De gemelde functionaliteit gaat veel verder dan samenvatten. Het model kan spreadsheets analyseren, gegevens categoriseren, formules opstellen, documenten vormgeven, presentaties bouwen, front-ends genereren, SVG's bewerken en het eindresultaat controleren.
Deze uitvoer gebruikt verschillende representaties. Spreadsheetformules moeten correct rekenen. SVG-elementen moeten hun geometrie behouden. Presentaties moeten de referenties volgen. Front-ends moeten in een browser werken, niet alleen overtuigend ogen als gegenereerde code.
De richtlijnen voor GPT-6 Astra melden ook dat het model schrijft met minder clichématige AI-formuleringen. Die verbetering is relevant, maar vormt zwakker bewijs dan succesvol schakelen tussen onderzoek, code, visuele controle en bedrijfssoftware.
Codebenchmarks testen geconcentreerde technische vaardigheden. Algemene intelligentie wordt geloofwaardiger wanneer hetzelfde model van data-analyse kan overstappen naar het bouwen van een interface, vervolgens de uitvoer controleert en fouten herstelt.
Juist hier moeten ook de beoordelingsnormen omhoog. Een fraai vormgegeven spreadsheet kan een onjuiste formule bevatten. Een professionele presentatie kan een bron verkeerd weergeven. Visuele kwaliteit mag onafhankelijke verificatie nooit vervangen.
Waarom dit belangrijk is: Breedte over verschillende, niet-gerelateerde eindproducten ondersteunt de AGI-claim sterker dan uitmuntende prestaties op één code- of reasoningtest.
Producten die computerbediening en tool calling nodig hebben, kunnen Astra benaderen via OpenAI's Responses API met model-ID gpt-6-astra. De reasoning-inspanning moet bij de taak passen: lagere instellingen zijn geschikt voor duidelijk afgebakende transformaties, terwijl complex werk in meerdere applicaties high of max kan rechtvaardigen.
De gedocumenteerde basistarieven bedragen $10 per miljoen inputtokens, $1 per miljoen gecachete inputtokens en $50 per miljoen outputtokens. Voor prompts van meer dan 272.000 tokens gelden hogere tarieven. Batch en Flex kunnen de kosten verlagen voor workloads die vertraagde of variabele verwerking toestaan, aldus de modelpagina van GPT-6 Astra.
De ChatGPT-desktopapp en Codex bieden een andere route wanneer Astra gecontroleerde toegang nodig heeft tot lokale bestanden, terminals, browsers of desktopapplicaties. De toegang wordt gefaseerd uitgerold: eerst voor een beperkt aantal organisaties en daarna voor Plus-, Pro-, Business-, Enterprise- en API-gebruikers. AWS staat eveneens vermeld als geplande toegangsroute. Controleer de beschikbaarheid op de publicatiedatum per account en regio, in plaats van die uit een aankondiging af te leiden.
Persistente runtimes lossen een ander probleem op:
| Uitvoeringsoptie | Rol | Meest geschikt voor |
|---|---|---|
| Responses API | Tool calling en modelorchestration | Productintegraties |
| ChatGPT-desktop en Codex | Gecontroleerde toegang tot lokale applicaties | Ontwikkel- en kenniswerk |
| OpenClaw of Hermes | Persistente agentruntime | Langlopende autonome taken |
| Docker | Bundelt applicaties en afhankelijkheden | Herhaalbare uitvoering |
| AWS | Beheerde rekenkracht, opslag en netwerken | Productie-infrastructuur |
| Abacus AI Supercomputer | Altijd beschikbare computer die via natuurlijke taal wordt aangestuurd | Gehoste apps en onbeheerd werk |
Abacus AI Supercomputer kan een agent online houden, een openbare applicatie hosten, opslag of een database koppelen en doorgaan nadat de laptop van de gebruiker is afgesloten. OpenClaw en Hermes bieden persistente agentruntimes, terwijl Docker de software bundelt die Astra nodig heeft om taken uit te voeren.
Deze lagen bewijzen geen intelligentie. Ze voegen beschikbaarheid, isolatie, netwerkmogelijkheden, opslag en herstelbare status toe. Uitrolinfrastructuur verwarren met modelcapaciteiten leidt tot overtrokken claims.
World of AI, Vibe Coding Benchmark en promptbibliotheken passen beter binnen testworkflows. Ze kunnen herhaalbare taken aanbieden, maar vormen geen centraal bewijs voor operationele AGI.
Waarom dit belangrijk is: Algemene intelligentie wordt pas economisch bruikbaar als er een veilige, persistente en observeerbare omgeving is waarin zij kan handelen.
GPT-6 Astra kost naar verluidt per token ongeveer 2,5 keer zoveel als GPT-5.6 Sol. Die vergelijking is onvolledig, want goedkopere tokens kunnen alsnog tot een duurder resultaat leiden wanneer een model meer retries, meer menselijke tussenkomst of een langer uitvoeringstraject nodig heeft.
Een gerapporteerde vlucht simulatie duurde ongeveer 20,5 minuten, verbruikte circa 1,63 miljoen tokens en kostte rond de $28. Een gerapporteerde Sol-run kostte $661, maar dit is geen zuivere modelvergelijking. Astra draaide op Ultra met zes subagents. Sol draaide zelfstandig op High. Claude Fable 5.1 wordt als een ander vergelijkingsmodel genoemd, maar verschillen in inspanningsniveau, aantal agents, contextverwerking en toolbeleid maken een gecontroleerde conclusie onmogelijk.
| Kostendimensie | Wat u moet meten |
|---|---|
| Modelgebruik | Kosten voor inputtokens, gecachete inputtokens en outputtokens |
| Runtime | Reken- en tooltijd |
| Menselijke beoordeling | Minuten besteed aan controle en correctie |
| Herstel | Retries, herstarts en herhaalde toolcalls |
| Afronding | Percentage taken dat zonder herstelwerk wordt geaccepteerd |
| Risico | Verwachte kosten van onjuiste of onveilige acties |
De betere rekeneenheid is de prijs per geaccepteerde taak. Een duurder model kan goedkoper uitvallen wanneer het de opdracht in één keer afrondt. Het kan ook veel duurder worden wanneer een lange context, maximale reasoning en subagents zonder budgetlimieten blijven draaien.
Teams die agentstacks evalueren, kunnen dit patroon vergelijken met de workflows in AI Developer Trends Weekly: Agent Stacks Take Over.
Waarom dit belangrijk is: De tokenprijs meet verbruik, terwijl de kosten per afgeronde taak de bedrijfswaarde meten.
Behandel Astra als een operator met uitgebreide rechten, niet als een schrijfassistent. De systeemkaart van GPT-6 Astra kent het model een kritieke cyberbeveiligingsclassificatie toe en beschrijft strengere beveiligingsmaatregelen.
Die classificatie vloeit rechtstreeks voort uit de werkcyclus. Een model dat software kan installeren, terminals kan bedienen, fouten kan onderzoeken en zijn aanpak kan aanpassen, kan waardevol beheerwerk uitvoeren. Dezelfde mogelijkheden kunnen worden ingezet voor binnendringen, het behouden van toegang of geautomatiseerde exploitatie.
Verminderde controleerbaarheid levert nog een probleem op. Wanneer doorslaggevende reasoning wordt gecomprimeerd, verborgen blijft of over subagents wordt verspreid, kunnen beoordelaars de acties wel zien zonder een getrouwe uitleg te krijgen van hoe het plan tot stand kwam.
Gegenereerd werk moet nog steeds worden beoordeeld. Computertaken kunnen traag blijven. De browserstatus kan veranderen. Rechten kunnen verkeerd worden geïnterpreteerd. Een visueel correct resultaat kan feitelijke, financiële of beveiligingsfouten verbergen.
Geschikte beheersmaatregelen zijn onder meer accounts met minimale rechten, geïsoleerde omgevingen, allowlists voor domeinen, bestedingslimieten, onveranderbare auditlogs en goedkeuringsstappen vóór destructieve of externe acties. Workflows met grote gevolgen vereisen bovendien onafhankelijke controles die niet afhankelijk zijn van Astra's beoordeling van het eigen werk.
Important
Geef een autonome agent niet automatisch toegang omdat een menselijke gebruiker die toegang al heeft. Maak taakspecifieke inloggegevens met beperktere rechten en een korte geldigheidsduur.
Het sterkste argument om Astra als AGI te beschouwen, is ook de reden om het model voorzichtig in te zetten. Een systeem dat algemeen werk kan afronden, kan ook schadelijk werk voltooien.
Waarom dit belangrijk is: Veiligheid is geen voorbehoud dat pas na de AGI-claim wordt toegevoegd. Het is bewijs dat operationele autonomie daadwerkelijk gevolgen heeft gekregen.

Kies vijf taken uit verschillende domeinen en leg vóór de uitvoering de acceptatiecontroles vast. Een bruikbare set kan bestaan uit het herstellen van een spreadsheet, browseronderzoek, het bijwerken van een CRM, het aanpassen van een front-end en het debuggen van een onbekende applicatie.
Meet het voltooiingspercentage, de verstreken tijd, tokenkosten, menselijke interventies, onveilige acties en resterende fouten. Voer elke taak uit met dezelfde rechten, reasoning-inspanning, time-out en hetzelfde retrybeleid.
Wijzig daarna steeds één factor tegelijk. Vergelijk standaardcontextverwerking met behouden reasoning, één agent met subagents en high met max. Het patroon laat zien of de verbetering voortkomt uit het model, de harness of extra rekenkracht.
Astra passeert de praktische AGI-drempel wanneer het herhaaldelijk onbekend werk in verschillende domeinen afrondt zonder stapsgewijze menselijke aansturing. Eén indrukwekkende demo is niet genoeg.
Waarom dit belangrijk is: Gecontroleerde tests van de werkcyclus maken van het AGI-debat een technisch vraagstuk met waarneembare resultaten.
Begin hier
Selecteer één browsertaak met een duidelijk omschreven eindtoestand en leg vast of Astra deze zonder menselijke navigatie afrondt.
Snel resultaat
Verdieping
GPT-6 Astra kwalificeert volgens een praktische definitie als AGI, omdat het resultaten kan nastreven via planning, toolgebruik, controle, correctie en afronding. Het sterkste bewijs komt uit volledige werkcycli in browsers, bestanden, professionele software, code en interactieve 3D-omgevingen.
De claim kent nog steeds duidelijke beperkingen. Het ontwerp van de harness kan vergelijkingen vertekenen. Langlopende computertaken blijven duur en traag. Gegenereerd werk moet worden beoordeeld en benchmarks met uiteenlopende instellingen maken geen zuivere modelvergelijking mogelijk.
De relevante vraag is niet langer of Astra intelligent klinkt. De vraag is of het een afgebakende taak veilig, herhaaldelijk en tegen aanvaardbare totale kosten kan afronden. Ontwikkelaars kunnen dat beantwoorden met gecontroleerde evaluaties van de werkcyclus, zonder te wachten op universele overeenstemming over het begrip AGI.