Loading blog posts...
Loading blog posts...
Laden...

De hoofdclaim klopt niet, en de data die dit weerlegt is interessanter dan de claim zelf. Kimi K3 is met 2,8 biljoen parameters het grootste open-weight model ooit uitgebracht, en toch staat het pas op de vierde plek onder frontier-modellen. Wat open weights in 2026 daadwerkelijk hebben overgenomen, is tokenvolume, niet capaciteit. Dat zijn twee compleet verschillende scoreborden.
Op de Artificial Analysis Intelligence Index scoort K3 een 57. Claude Fable 5 van Anthropic scoort 60. GPT-5.6 Sol van OpenAI scoort 59. K3 verslaat Claude Opus 4.8 nipt, en dat is de hele marge (Codersera benchmarkvergelijking).
Moonshot AI betwist dit niet. In de eigen lanceringspost geeft het bedrijf toe dat K3 op algemene capaciteit achter de twee Amerikaanse frontier-modellen blijft (Moonshot AI techblog). Die openheid is belangrijk, want het meeste nieuws dat iets anders beweert, citeert head-to-head cijfers van de leverancier zelf, die niemand onafhankelijk heeft gereproduceerd.
Waar K3 wél wint, is smal en specifiek. Het model staat bovenaan de Frontend Code Arena met 1.679 tegenover 1.631 voor Fable 5, staat gelijk met GPT-5.6 op de Coding Agent Index met 57, leidt SWE Marathon met 42,0, en verslaat Fable 5 op Terminal Bench 2.1 (88,3 tegenover 84,6). Op GDPval v2, de breedste benchmark voor realistische taken, staat het duidelijk op de tweede plaats.
Waarom dit ertoe doet: K3 is het beste open-weight model dat bestaat en de categorieleider op het gebied van coding agents. Geen van beide maakt het tot het beste model.
Dit is het echte verhaal, en het speelt al een jaar op. Modellen van Amerikaanse oorsprong (OpenAI, Anthropic, Google) daalden van ongeveer 70% van het OpenRouter-tokenverkeer in juni 2025 naar zo'n 30% medio 2026. Chinese modellen bereikten 61% van het totale tokenverbruik in februari 2026, met een piek van bijna 46% van het Amerikaanse zakelijke tokenvolume (FourWeekMBA-analyse van OpenRouter-data).
De totale doorvoer op het platform groeide van circa 5 biljoen tokens per week in april 2025 naar meer dan 20 biljoen in april 2026. DeepSeek is koploper onder alle aanbieders qua ruwe tokenaantallen. Dat is een verviervoudiging van de markt, waarbij het extra volume overwegend naar open weights ging. Niet omdat open modellen beter werden dan gesloten modellen, maar omdat ze goed genoeg werden tegen een prijs die bepaalde welke workloads economisch überhaupt haalbaar waren.
Waarom dit ertoe doet: Open weights hebben de workloads gewonnen waar kosten per token de architectuurkeuze bepalen, en dat zijn de meeste.

Anthropic heeft ongeveer 12 tot 13% van het OpenRouter-tokenaandeel, maar pakt een veel groter deel van de omzet. Een model van $0,09 per miljoen tokens kan de tokenaantallen domineren, terwijl een model van $5 per miljoen tokens de facturen domineert.
Dat is precies de splitsing die bijna elke "open verslaat gesloten"-post samenperst tot één getal. Tokenaandeel meet waar het goedkope, hoogvolumewerk draait: classificatie, extractie, samenvatting, retrieval reranking. Omzetaandeel meet waar het werk met hoge inzet draait: langdurige agentic taken, code review op productiesystemen, alles waarbij een fout antwoord meer kost dan de inference zelf.
Important
Vraag u bij elke "open modellen winnen"-claim in 2026 af welk scorebord er wordt aangehaald. Volume, capaciteit en omzet bewegen elk een andere kant op, en één grafiek die er slechts één van laat zien, vertelt u vrijwel niets over de andere twee.
Waarom dit ertoe doet: Open weights hebben het tokenaantal binnengehaald. Gesloten labs behielden de marge, en marge financiert de volgende trainingsronde.
Hier volgt de bevinding die het overtreffings-verhaal definitief zou moeten beëindigen. Sinds januari 2026 lopen de beste open modellen gemiddeld vier maanden achter op de gesloten frontier-modellen, oftewel 8 ECI-punten. Van januari 2023 tot en met oktober 2025 was die achterstand ongeveer drie maanden. Onder strengere vergelijkingsregels loopt de huidige kloof zelfs op tot zes maanden (Epoch AI).
De kloof werd groter, niet kleiner, precies in het jaar waarin iedereen riep dat hij gedicht was. Epoch schrijft dit toe aan een groeiend verschil in compute-investeringen. Daarnaast wijst het instituut op een meetprobleem dat u zich eigen moet maken: publieke benchmarks kunnen open modellen systematisch bevoordelen, omdat publieke testsets nu eenmaal makkelijker te optimaliseren zijn dan private, achtergehouden evaluaties (Epoch AI open-modellenrapport).
Waarom dit ertoe doet: Als open-weight releases dichter bij de frontier lijken te staan dan ze echt zijn, is elke inkoopbeslissing die op benchmarks stoelt systematisch bevooroordeeld richting open modellen.
Het aantal parameters is een krantenkop. De echte engineering zit in de sparsity. K3 activeert 16 van de 896 experts per token via wat Moonshot een Stable LatentMoE-architectuur noemt. De toewijzing van experts gebeurt via Quantile Balancing, waarbij routing wordt afgeleid uit router-score-kwantielen in plaats van een handmatig afgestelde load-balancing-coëfficiënt. Dat elimineert een van de meest fragiele hyperparameters in het trainen van grote MoE-modellen. Moonshot claimt ruwweg 2,5 keer de schaaleffciëntie van K2.
Het überhaupt kunnen serveren van een model van 2,8 biljoen parameters hangt af van quantization-aware training, die vanaf de supervised fine-tuning-fase wordt toegepast met MXFP4-gewichten en MXFP8-activaties. Dat verlaagt de vereiste geheugenbandbreedte met ongeveer een factor 4 ten opzichte van FP16 (Tom's Hardware).
Ook op het specificatieblad: native multimodaliteit, een contextvenster van 1 miljoen tokens, en altijd actieve redenering zonder aan/uit-schakelaar.
Waarom dit ertoe doet: De interessante claim is niet 2,8 biljoen parameters. Het is dat quantization-aware training vanaf de SFT-fase een model van die omvang bruikbaar maakte tegen concurrerende kosten per taak.

Een schatting op basis van 4-bit weight-only quantisatie plaatst K3 op zo'n 1,4 TB VRAM. Een RTX 4090 heeft 24 GB. Vier H100's van 80 GB leveren samen 320 GB, wat het model alleen laadt bij verlaagde precisie, met een verkorte context van 128K tot 256K en merkbaar lagere doorvoer. Moonshots eigen richtlijnen wijzen op supernode-configuraties van 64 of meer accelerators. Er is geen minimale, haalbare GPU-specificatie gepubliceerd.
| Configuratie | Totaal VRAM | Kan K3 draaien? |
|---|---|---|
| RTX 4090 | 24 GB | Nee |
| 4x H100 80GB | 320 GB | Verlaagde precisie, 128K–256K context |
| Door Moonshot aanbevolen supernode | 64+ accelerators | Ja, volledige context |
| Schatting 4-bit weight-only | ~1,4 TB vereist | Referentiecijfer |
Warning
"Open weights" en "u kunt het zelf hosten" zijn ergens rond de biljoen-parametergrens twee verschillende dingen geworden. Voor K3 betekent open weights dat cloudproviders en goed gefinancierde ondernemingen het zelf kunnen hosten. Hobbyisten kunnen dat niet, en geen enkele mate van quantisatie lost een footprint van 1,4 TB op consumentenhardware op.
De strategische conclusie: open weights worden een controlepunt voor inference in plaats van een democratiseringsmechanisme. Het vrijgeven van gewichten die niemand buiten een datacenter kan serveren, verschuift de concurrentie naar wie de hardware beheert, niet wie het model bezit.
Waarom dit ertoe doet: Beschikbaarheid van gewichten impliceert niet langer praktische onafhankelijkheid van cloudproviders.
De prijsstelling van K3 is het duidelijkste signaal dat Moonshot heeft afgegeven over hoe het bedrijf zichzelf positioneert.
| Model | Input (cache miss) | Input (gecached) | Output |
|---|---|---|---|
| Kimi K2.6 | $0,95/M | - | $4/M |
| Kimi K3 | $3,00/M | $0,30/M | $15/M |
| Claude Sonnet 5 | vergelijkbaar niveau | - | vergelijkbaar niveau |
Dat is een prijsstijging van 3 tot 4 keer ten opzichte van de vorige generatie, waarmee K3 op gelijk niveau komt met Claude Sonnet 5 (The Decoder). De kosten per taak komen uit rond de $0,94, vergelijkbaar met GPT-5.6 Sol en ongeveer de helft van Opus 4.8. K3 blijft dus concurrerend qua totale uitgaven. Alleen is het geen budgetoptie meer. Moonshot prijst op basis van capaciteit, wat een lab doet zodra het gelooft dat zijn model die prijs waard is.
Het cachetarief van $0,30 per miljoen inputtokens is het cijfer waar u uw architectuur op moet afstemmen. Een verschil van factor 10 tussen cache hit en cache miss betekent dat promptstructuur, en niet modelkeuze, de bepalende kostenvariabele wordt bij herhaalde agentic calls.
Waarom dit ertoe doet: De prijsarbitrage die de adoptie van Chinese modellen op OpenRouter dreef, sluit zich op frontier-niveau, ook al blijft ze verderop in de stack bestaan.
De hands-on tests van Simon Willison leverden de nuttigste primaire data op vóór de release van de gewichten. Bij één enkele prompt verbruikte K3 13.241 reasoning tokens om 3.417 outputtokens te produceren. Dat is een verhouding van 3,9 op 1, en ongeveer 25 dollarcent voor één verzoek (Simon Willison).
Altijd actieve redenering betekent dat er geen schakelaar is om dit uit te zetten. Bij $15 per miljoen outputtokens, waarbij reasoning tokens tegen het outputtarief worden gefactureerd, verandert een verhouding van 3,9 op 1 de kostenstructuur van elke toepassing met een hoog volume.
Hij vond ook een verborgen systeemprompt van ongeveer 85 tokens, en beoordeelde de visuele capaciteiten hoog: het model schreef nauwkeurige alt-tekst voor een afbeelding die het zelf had gegenereerd.
Zijn bredere waarschuwing verdient meer aandacht dan de benchmarktabellen. Informele benchmarks drijven steeds verder af van wat er in de praktijk daadwerkelijk toe doet: de betrouwbaarheid van agentic tool-calling over lange gesprekken heen. Dat is waar teams in week drie van een uitrol tegenaan lopen, en geen enkel leaderboard meet dat goed. Onze gids voor het bouwen van een AI-nieuwsradar beschrijft hoe u dit soort primair testwerk kunt volgen in plaats van persberichten.
Waarom dit ertoe doet: Een reasoning-tokenoverhead van bijna 4 keer is een begrotingspost, geen voetnoot.

Er circuleren deze week drie beweringen die niet als feit gepresenteerd zouden moeten worden.
Het bericht dat K3 "in 48 uur een chip bouwde" met "meer dan 8.700 tokens per seconde" vermengt een demonstratie van ontwerpassistentie met een inference-doorvoercijfer. Beide getallen komen uit verschillende contexten, en de gecombineerde claim is niet geverifieerd.
Head-to-head overwinningen op GPT-5.6 Sol en Fable 5, inclusief het cijfer over "vijf van de zes agentic benchmarks", zijn grotendeels door de leverancier zelf gerapporteerd. Moonshot voerde deze tests uit.
Dan is er de framing zelf. Bloomberg en Fortune omschrijven K3 als China dat de kloof verkleint, wat verdedigbaar is. Axios en Business Insider berichten over echte onrust in Silicon Valley en Washington, wat reëel en nieuwswaardig is. Maar die onrust is het verhaal, niet de overwinning. Het waarschijnlijke vervolg is beweging op het gebied van exportcontrole en open-weights-beleid, wat direct aansluit bij de discussie over het verbod op open-source AI van eerder deze maand.
Waarom dit ertoe doet: Precies in de kloof tussen wat de data laat zien en wat de berichtgeving suggereert, worden slechte inkoopbeslissingen genomen.
Begin hier Haal uw LLM-uitgaven van de afgelopen 30 dagen op en splits ze in twee categorieën: hoogvolume calls met lage inzet en laagvolume calls met hoge inzet. Die verdeling, en niet een benchmarktabel, vertelt u of K3 relevant is voor uw stack.
Snelle winst
Diepgaander
Drie scoreborden, drie verschillende winnaars. Open weights hebben het volume overtuigend binnengehaald. Gesloten modellen behielden de capaciteit en, volgens Epoch, breidden hun voorsprong in 2026 zelfs uit. Gesloten labs hielden de omzet vast die de volgende compute-cyclus financiert.
Kimi K3 is een echte prestatie: het grootste beschikbare open-weight model, het beste open model op de markt, en de categorieleider onder coding agents. Het is niet het beste model, en het lab dat het bouwde geeft dat zelf toe.
27 juli is de datum die ertoe doet. Tot de gewichten en het technisch rapport beschikbaar zijn, is elke circulerende benchmark ofwel door de leverancier zelf gerapporteerd, ofwel gebaseerd op een handjevol vroege tests. Als uw team deze week architectuurbeslissingen moet nemen, wacht dan die tien dagen.
Voor organisaties die uitzoeken waar open-weight modellen passen naast gesloten API's in een productiestack: Joulyan IT bouwt AI-integratie- en automatiseringssystemen die zijn ontworpen rond die afweging tussen kosten en capaciteit, niet rond welk model vorige week toevallig bovenaan een leaderboard stond.