Loading blog posts...
Loading blog posts...
Laden...

Claude Sonnet 5.5 en GPT-6.1 Sol hanteren nu allebei een prijs van $2 voor input en $10 voor output. Nu intelligentie van bijna het hoogste niveau goedkoper wordt, draaien inkoopbeslissingen vooral om de aansluiting op tooling, de uitrol van modellen met open gewichten en operationele controle.
In het kort
Anthropic bracht Claude Sonnet 5.5 uit op 28 september, gevolgd door OpenAI's GPT-6.1 Sol tijdens DevDay op 29 september. Tegen de standaardtarieven kosten beide modellen evenveel, maar hun API-gedrag verschilt genoeg om overstappen op basis van benchmarks onverstandig te maken.
| Model | Release | Input per 1 mln. tokens | Output per 1 mln. tokens | Operationeel onderscheid |
|---|---|---|---|---|
| Claude Sonnet 5.5 | 28 september | $2,00 | $10,00 | Terminal-Bench 4.0-score van 70,6% |
| GPT-6.1 Sol | 29 september | $2,00 | $10,00 | Contextvenster van 1,05 mln. en gecachte input voor $0,10 |
| Claude Haiku 5.5 | 7 oktober | $0,10 | $0,50 | Standaardtarief geldt voor prompts tot 100.000 tokens |
| Mistral Large 4 | 6 oktober | $1,36 | $4,18 | API-preview, gewichten volgen naar verwachting later |
Anthropic meldt dat Sonnet op Terminal-Bench 4.0 verbeterde van 10,3% naar 70,6%. Deze benchmark test agents die via terminalomgevingen werken. Teams die thinking hebben uitgeschakeld, moeten overstappen op de nieuwe instelling between_tools, omdat bestaande configuraties zich niet hetzelfde zullen gedragen.
GPT-6.1 Sol kent andere beperkingen:
272,000 inputtokens kosten tweemaal het normale inputtarief.reasoning.effort lopen van low tot max.Volgens OpenAI benadert Sol de prestaties van GPT-6 Astra tegen een vijfde van Astra's standaardtokenprijs, zo blijkt uit de berichtgeving rond de DevDay-lancering. De meeste engineeringteams doen er goed aan om naast de gepubliceerde basistokenprijs ook het voltooiingspercentage van taken, het aantal nieuwe pogingen en de betrouwbaarheid van tool calls te vergelijken.
Waarschuwing
Beschouw het contextvenster van 1,05 miljoen tokens van GPT-6.1 Sol niet als een functie met een vast tarief. Zodra u de grens van 272,000 tokens overschrijdt, verandert de prijs van de volledige aanvraag, niet alleen die van de extra tokens.

Anthropic bracht Claude Haiku 5.5 op 7 oktober uit en positioneerde het onder Sonnet en Opus voor complexe agentic coding-taken. Volgens de aankondiging van Haiku 5.5 richt het model zich op contextcompressie, samenvattingen en afgebakende taken voor subagents.
Het prijsverschil is te groot om te negeren:
$0.10 per miljoen tokens$0.50 per miljoen tokens100,000 tokensGebruik Haiku voor begrensde taken met een hoog volume en valideer de resultaten. Schaal mislukte of onzekere uitvoer op naar Sonnet of Opus voor ambigue planning en lastige codewijzigingen. Elke tussenstap naar Sonnet 5.5 sturen is voor zowel input als output twintig keer zo duur, zonder dat het eindantwoord genoeg verbetert om die meerprijs te rechtvaardigen.
Mistral stelde Large 4 op 6 oktober als publieke preview beschikbaar via de Mistral Studio API. Het bedrijf omschrijft het als een mixture-of-experts-model met in totaal ongeveer één biljoen parameters, waarvan er per token 52 miljard actief zijn, aldus de officiële release.
De kosten van inference hangen af van het aantal actieve parameters, niet van het totale aantal parameters. Door voor elk token slechts een deel van het model te gebruiken, krijgt u de capaciteit van een groot model zonder bij iedere aanvraag het volledige netwerk te activeren.
De API-tarieven zijn scherp, maar teams die een private uitrol plannen, kunnen beter wachten op de definitieve licentie, de vereisten voor serving en de geheugenvoetafdruk voordat ze architectuur- of budgetkeuzes vastleggen:
$1.36 per miljoen tokens$4.18 per miljoen tokens
Reflection kondigde Beam aan op 5 oktober, terwijl Aleph Alpha Kolibri op 3 oktober uitbracht. Beide gebruiken sparse mixture-of-experts-architecturen. Kolibri is nu al te downloaden; voor Beam geldt nog een wachtlijst.
| Model | Totaal aantal parameters | Actieve parameters | Licentiestatus | Huidige toegang |
|---|---|---|---|---|
| Reflection Beam | 501 mld. | 23 mld. | Apache 2.0 toegezegd | Wachtlijst |
| Aleph Alpha Kolibri | 78 mld. | Ongeveer 3 mld. | Apache 2.0 beschikbaar | Downloadbare gewichten |
| Mistral Large 4 | Ongeveer 1 bln. | 52 mld. | Niet bekendgemaakt | Preview van gehoste API |
Reflection rapporteert voor Beam een score van 80,9 op SWE-Bench Verified. Het model ondersteunt uitsluitend tekst en blijft op de wachtlijst staan totdat de toegezegde Apache 2.0-release later in oktober beschikbaar komt.
Kolibri is minder spectaculair, maar wel directer inzetbaar. Het ondersteunt Engels en Duits, biedt een contextvenster tot één miljoen tokens en is al gepubliceerd onder Apache 2.0. Voor serving is echter de inferenceplugin van Aleph Alpha voor vLLM nodig.
Voor Kolibri-implementaties met meer dan 262,144 tokens zijn extra servingflags nodig. Teams kunnen het geheugenverbruik en de latency daarom beter testen met de contextlengtes die ze daadwerkelijk gebruiken, in plaats van de maximale specificatie als normaal werkpunt te beschouwen.
Opmerking
Open gewichten nemen de implementatiekosten niet weg. Ze leggen de verantwoordelijkheid voor inferencecapaciteit, observability, updates, beveiligingsmaatregelen en licentiecontrole bij uw team.
Cloudflare bracht Clef en Clef-flash op 1 oktober uit als beslismodellen onder Apache 2.0. Ze leveren begrensde, getypeerde uitvoer met waarschijnlijkheden, zoals beschreven in de aankondiging van Clef.
De interface is geschikt voor routering, beleidscontroles, classificatie en beslismomenten in workflows:
@cf/cloudflare/clef.Architectonisch is dit de belangrijkste release van de groep. Kleine beslismodellen zijn in productie vaak de betere component wanneer de uitvoer rechtstreeks code moet aansturen. Een supportworkflow kan factureringsverzoeken met een hoge betrouwbaarheid automatisch routeren en gevallen met een lage betrouwbaarheid doorsturen naar een medewerker. U hoeft dan geen algemeen chatmodel om JSON te vragen en vervolgens maar te hopen dat het zich aan het schema houdt.

272,000 inputtokens bevatten voordat u Sol inzet voor workflows met een lange context.Gelijke prijzen in de kop maken de onderliggende architectuurverschillen zichtbaar, van tool-API's en contexttoeslagen tot implementatielicenties en getypeerde uitvoer.
De winnende stack stuurt niet alles naar één vlaggenschipmodel. Afgebakende taken gaan naar goedkope subagents, kostbare reasoning blijft voorbehouden aan moeilijke beslissingen en deterministische beslismodellen worden ingezet wanneer software een begrensd antwoord nodig heeft. Hetzelfde controlevraagstuk speelt een rol in de recente strijd om de controle over agents. Met deze releases is het een directe engineeringprioriteit geworden.