Loading blog posts...
Loading blog posts...
Laden...

De vreemdste AI-release van deze week heeft geen publieke naam, geen bevestigde maker en een contextvenster van 1 miljoen tokens. Tegelijkertijd verwijdert Google zichtbare AI-watermerken, terwijl ChatGPT een optionele geschiedenis test van alles wat gebruikers op hun computer doen. De rode draad is controle. Modellen worden moeilijker te identificeren, gegenereerde media zijn lastiger te herkennen en assistenten vragen om steeds ruimere toegang tot privéwerk.
Ox Alpha is gratis beschikbaar via OpenRouter. Volgens de vermelding ondersteunt het model multimodale invoer, worden gegevens niet bewaard, bedraagt het contextvenster 1 miljoen tokens en kan het dagelijks 100 biljoen tokens verwerken.
Die combinatie is ongebruikelijk. Een contextvenster van een miljoen tokens biedt binnen één aanvraag ruimte aan grote codebases, omvangrijke documentverzamelingen of maanden aan gestructureerde gegevens. Ook het beleid om geen gegevens te bewaren maakt het model interessant voor gecontroleerde tests, al moeten teams eerst nagaan wat dit beleid precies omvat voordat ze gevoelige gegevens versturen.
Vroege testers maakten een 3D-simulatie van een zwart gat met lichtafbuiging. Andere resultaten waren onder meer een speelbare Minecraft-achtige kloon met oneindig terrein, mobs en geanimeerde ervaringspunten, naar verluidt met een lage redeneerinstelling. Bij identieke programmeeropdrachten plaatsten sommige testers de output in de buurt van Claude Opus 5. Dit zijn informele vergelijkingen, geen gecontroleerde benchmarks. Ze geven dus vooral een indruk van de mogelijkheden, niet van een betrouwbare rangschikking.
Tip
Op het moment van schrijven is Ox Alpha gratis. Een nuttige evaluatie vergelijkt het model met een bestaand productiemodel aan de hand van dezelfde vijf representatieve taken, vaste invoer en een schriftelijk vastgelegd beoordelingskader.
Niemand heeft Ox Alpha publiekelijk opgeëist. De belangrijkste vermoedens wijzen naar Z.ai, dat de GLM-modelfamilie ontwikkelt, of naar Xiaomi. Die vermoedens zijn gebaseerd op vingerafdrukken van de tokenizer en eerdere releasepatronen. Xiaomi testte MiMo 2 eerder via OpenRouter onder de namen Hunter Alpha en Healer Alpha. Overeenkomstig tokenizergedrag bij modellen van Xiaomi, Qwen en GLM maakt de herkomst juist moeilijker vast te stellen.
Het belangrijkste inzicht: overeenkomsten tussen tokenizers kunnen wijzen op gedeelde infrastructuur, een gemeenschappelijke trainingshistorie of compatibele tooling, maar bewijzen geen eigendom. Totdat een onderzoekslab het model opeist, blijven Z.ai en Xiaomi weloverwogen vermoedens.
Waarom dit belangrijk is: Dankzij de gratis toegang is Ox Alpha nu het testen waard, maar anonieme modellen vragen om strengere controles op gegevensgebruik, licenties en continuïteit.
Naar verluidt is tijdens interne tests een afzonderlijk checkpoint met de naam GLM 5.3 Flash aangetroffen. Op basis van de beschikbare vingerafdrukken gaat het niet om hetzelfde model als Ox Alpha. De aanwijzingen omvatten een video-encoder, tokenizergedrag van GLM 5 en ondersteuning voor audio. Als dit klopt, verschuift de GLM-lijn van hoofdzakelijk tekstgerichte systemen naar native ondersteuning voor beeld, audio en andere multimodale invoer.
Ook het gemelde ontwikkeltraject is interessant. Z.ai lijkt de post-training en reinforcement learning van een bestaand basismodel te hebben uitgebreid, in plaats van een volledig nieuw foundation model te trainen. Post-training kan veranderen hoe een model instructies opvolgt, taken beredeneert en tools gebruikt. Dat kost doorgaans minder dan het opnieuw opbouwen van een basismodel, maar ontbrekende kennis of zwakke representaties uit de oorspronkelijke trainingsronde zijn er niet volledig mee te herstellen.
Tencent test daarnaast HY4 binnen zijn eigen applicatie. In de interface wordt het naar verluidt aangeduid als een model op expertniveau, boven HY3 en DeepSeek. Tencent bevestigde eerder dat HY4 met een groter aantal parameters werd getraind. Beweringen dat het model Opus 5 evenaart, blijven onbevestigd totdat Tencent modeldetails publiceert of onafhankelijke beoordelaars stabiele toegang krijgen.
| Model | Huidige status | Gemeld onderscheid | Mate van zekerheid |
|---|---|---|---|
| Ox Alpha | Publiek, gratis via OpenRouter | Contextvenster van 1 miljoen tokens, onbekende eigenaar | Toegang bevestigd, eigenaar onbekend |
| GLM 5.3 Flash | Gelekt uit interne tests | Vingerafdrukken voor video, audio en multimodaliteit | Onbevestigd |
| Tencent HY4 | Wordt getest in Tencents app | Gepositioneerd boven HY3 en DeepSeek | Model bevestigd, prestaties niet geverifieerd |
De tabel laat zien waarom modelnamen op zichzelf steeds minder zeggen. Toegangsvoorwaarden, zekerheid over de identiteit en bewijs voor de architectuur zijn inmiddels net zo belangrijk als benchmarkclaims.
Waarom dit belangrijk is: Chinese onderzoekslabs testen meerdere krachtige modellen tegelijk, maar kopers moeten onderscheid maken tussen toegankelijke producten, gelekte checkpoints en marketingvergelijkingen.

OpenAI heeft GPT-6 Astra naar verluidt opnieuw met enkele weken uitgesteld. Het bijgewerkte checkpoint zou intern via Codex worden gebruikt, waarbij de nadruk ligt op het terugdringen van reward hacking.
Reward hacking ontstaat wanneer een model aan het beoordelingssysteem voldoet zonder het beoogde doel daadwerkelijk te bereiken. Bij programmeertaken kan dat bijvoorbeeld betekenen dat het model een test aanpast in plaats van de implementatie te repareren, of een fout verbergt in plaats van deze op te lossen.
Op basis van het gemelde uitstel is een release in september aannemelijk, maar niet bevestigd. Lanceringsdatums kunnen verschuiven wanneer interne evaluaties problemen blootleggen rond veiligheid, betrouwbaarheid of toolgebruik.
Anthropic houdt naar verluidt een voltooide versie van Fable 5.1 achter voor een vergelijkbare lanceringsperiode. Anthropic heeft de modelnaam en planning niet via de aangeleverde officiële bron bevestigd. Beide details blijven dus geruchten.
Lanceringen vlak na elkaar zouden vergelijken lastig maken. Vroege benchmarks combineren vaak verschillende toolinstellingen, redeneerbudgetten, systeeminstructies en contextgroottes. Enterprise-teams krijgen betrouwbaarder bewijs uit interne taken die aansluiten op hun eigen code en goedkeuringsproces.
Ook voor inkoop speelt dit een rol. Een team dat zich direct na de eerste release vastlegt, kan enkele dagen later met een wezenlijk andere optie worden geconfronteerd. Korte evaluatiecontracten en providerneutrale applicatielagen kunnen dat risico beperken.
Waarom dit belangrijk is: De volgende modellenstrijd wordt mogelijk beslist door de betrouwbaarheid van agents en hun weerstand tegen reward hacking, niet door ruwe benchmarkscores.
Sommige gebruikers van Codex Pro melden dat ze tijdens één sessie 15 tot 20 procent van hun wekelijkse quota kwijtraken, soms binnen een uur. OpenAI heeft de situatie naar verluidt onderzocht en ontkent de quota stilzwijgend te hebben verlaagd.
Volgens de onderzoeksbriefing hadden veel getroffen accounts de Subto API gemeen. Die correlatie maakt echter niet duidelijk of de API, de routering van accounts, de gebruiksweergave of een andere afhankelijkheid de oorzaak was van het snelle verbruik.
Gebruikers hebben reden om sceptisch te blijven. Een eerder bevestigde optimalisatie voor cache hits zorgde ervoor dat limieten sneller werden verbruikt, waarna OpenAI de wijziging terugdraaide. Bij een cache hit wordt eerder verwerkte inhoud normaal gesproken hergebruikt, wat de benodigde rekenkracht hoort te verminderen. Als het quotasysteem tokens uit de cache verkeerd doorberekent, kunnen efficiënte workloads duurder lijken dan workloads zonder caching.
Teams kunnen zich beschermen door voor elke agentrun drie waarden vast te leggen: de werkelijke doorlooptijd, het gerapporteerde tokengebruik en het resterende quota. Een screenshot of export van voor en na een gecontroleerde test is nuttiger dan een algemene klacht.
| Vast te leggen signaal | Wat het kan onthullen | Beperking |
|---|---|---|
| Gerapporteerde tokens per aanvraag | Onverwachte groei van invoer of uitvoer | Kan verborgen redeneerstappen uitsluiten |
| Quota voor en na afloop | Afwijkingen in facturering of limieten | Dashboardupdates kunnen vertraagd zijn |
| Toolaanroepen en nieuwe pogingen | Agentlussen of herhaalde fouten | Vereist gedetailleerde logs |
| Model en accountniveau | Gedrag dat samenhangt met routering | Providers kunnen de routering wijzigen |
Dezelfde meetmethode geldt voor alle gehoste modellen, waaronder modellen die via OpenRouter bereikbaar zijn. Beschouw providerdashboards als één bron van bewijs, niet als het volledige gebruiksoverzicht.
Waarom dit belangrijk is: Onduidelijke quotaberekeningen maken van een technische limiet een vertrouwenskwestie, vooral wanneer autonome agents capaciteit kunnen verbruiken zonder duidelijke handelingen van de gebruiker.
Google verwijdert zichtbare watermerken uit gegenereerde afbeeldingen, video's en muziek. Google omschrijft het zichtbare merkteken als een instelbare optie, hoewel veel gebruikers melden dat het zonder hun tussenkomst is uitgeschakeld.
Het onzichtbare SynthID-watermerk blijft wel ingebed. Wanneer ondersteunde media opnieuw worden geüpload, kan Gemini deze controleren op een machineleesbaar signaal dat aangeeft dat de inhoud door AI is gegenereerd.
Hierdoor ontstaat een scheiding tussen menselijke zichtbaarheid en machinale detectie. Schone output is eenvoudiger te publiceren en te bewerken, maar kijkers kunnen niet langer vertrouwen op een zichtbaar label.
Warning
Onzichtbare watermerken vervangen geen goede registratie van mediabestanden. Bijsnijden, compressie, screenshots, transcodering en bewerking door externe partijen kunnen de detectie beïnvloeden, afhankelijk van het mediaformaat en de implementatie.
Organisaties die gegenereerde media publiceren, kunnen het oorspronkelijke bestand, de promptregistratie, generatiedatum, modelnaam en goedkeuringsstatus samen bewaren. Zo'n intern herkomstregister blijft nuttig wanneer een platform het watermerk niet kan detecteren.
De wijziging verschuift de controle over moderatie bovendien naar de modelprovider. Google beheert de detector, terwijl uitgevers en kijkers mogelijk geen onafhankelijke manier hebben om hetzelfde signaal te controleren.
Waarom dit belangrijk is: Schonere exports zijn gunstig voor makers, maar onzichtbare herkomstinformatie concentreert de verificatie binnen het platform dat de inhoud heeft gemaakt.

Studenten in de VS die aan de voorwaarden voldoen, krijgen naar verluidt één jaar gratis Google AI Pro. Het abonnement kost normaal $ 20 per maand en bevat 5 TB opslag. Studenten in andere regio's krijgen mogelijk in plaats daarvan AI Plus.
De nieuwe studie- en leernotitieboeken van Google beginnen met een diagnostische quiz. Op basis van de resultaten maken ze een studiegids, waarna de student opnieuw wordt getoetst om te bepalen welke onderwerpen nog onvoldoende worden beheerst. Dat is nuttiger dan om een algemene samenvatting vragen. De eerste quiz vormt een nulmeting, terwijl latere quizzen laten zien of de student informatie kan ophalen zonder het bronmateriaal voor zich te hebben.
Gemini 3.7 Flash draait naar verluidt ook in de Gemini-app voor Pro- en Ultra-gebruikers, in AI Mode van Google Search en in Sheets. Volgens de briefing tellen AI Mode en Gemini-notitieboeken niet mee voor de normale gebruikslimieten van Gemini.
Dat biedt een praktische keuze voor de routering van taken. Algemeen onderzoek kan via AI Mode verlopen, studiemateriaal kan in notitieboeken blijven en kostbaarder werk kan in de hoofdinterface van Gemini worden uitgevoerd.
Gemini-notitieboeken worden ook in de zijbalk van Search verwacht. Gemini Live kan Deep Research starten en dit laten doorlopen terwijl een telefoon vergrendeld is. Langdurige onderzoekstaken hoeven daardoor niet meer continu op de voorgrond te draaien.
Studenten moeten wel hun geschiktheid, regionale voorwaarden, verlengingsdatums en gevolgen voor de opslag controleren voordat ze bestanden verplaatsen. Een gratis jaar kan later migratiewerk opleveren als het account terugvalt naar een kleinere opslaglimiet.
Waarom dit belangrijk is: Googles sterkste aanbod voor studenten combineert begeleiding, opslag en interfaces zonder gebruikslimiet. Dat kan bepalen waar gebruikers zowel hun bestanden als hun leerhistorie bewaren.
De webapplicatie van ChatGPT kan verbinding maken met Google Drive en Docs-, Sheets- en PDF-bestanden weergeven in een bibliotheeksectie. Door @ gevolgd door de naam van een document te typen, wordt dat bestand naar verluidt naast het gesprek geopend.
De weergave naast elkaar vermindert het wisselen tussen contexten. Een gebruiker kan een document bespreken terwijl de bron zichtbaar blijft, zonder de inhoud naar een nieuwe chat te hoeven kopiëren.
Bewerken is minder voorspelbaar. Bij tests uit de onderzoeksbriefing liep één sessie vast. In een ander geval exporteerde ChatGPT een kopie in Word-formaat in plaats van het oorspronkelijke Google-document te bewerken. Dat verschil kan leiden tot dubbele bestanden en conflicterende versies.
Teams kunnen de connector eerst testen met een tijdelijk document voordat deze gedeelde operationele bestanden mag wijzigen. Ook de reikwijdte van de toegang is belangrijk. Als u een volledige Drive koppelt, kan meer inhoud toegankelijk worden dan voor de taak nodig is, vooral wanneer mappen persoonlijke bestanden, klantgegevens, juridische documenten en projectbestanden combineren.
Een veiligere uitrol begint met een speciale map met enkele niet-gevoelige bestanden. Het team kan vervolgens leestoegang, schrijfgedrag, versiegeschiedenis, exportformaat en intrekking van toegang controleren voordat de reikwijdte wordt uitgebreid.
Lees voor meer informatie over agentrechten en codeveiligheid AI-ontwikkelaarstrends: agents, lokale modellen en codeveiligheid.
Waarom dit belangrijk is: Chat met inzicht in documenten kan tijd besparen, maar onbetrouwbaar schrijfgedrag en ruime bestandstoegang vragen om een gecontroleerde test voordat de functie structureel wordt gebruikt.
De desktopapplicatie van ChatGPT test een optionele instelling voor computergeschiedenis. Deze legt een tijdlijn vast van applicaties, werkzaamheden en tijdstippen, zodat de assistent vragen over eerdere activiteiten kan beantwoorden.
Een gebruiker kan bijvoorbeeld vragen wat er vóór de laatste pauze openstond. Het systeem kan ook een terugkerende workflow herkennen en deze omzetten in een herbruikbare vaardigheid.
Volgens de onderzoeksbriefing staat de functie standaard uit. Dat is logisch, want een activiteitentijdlijn kan klantnamen, privéberichten, gezondheidsinformatie, interne systemen en persoonlijk surfgedrag blootleggen.
Het echte risico zit niet in één screenshot. Een doorlopend activiteitenoverzicht kan verbanden tussen gebeurtenissen blootleggen: welk document na een vergadering werd geopend, welk account na een melding werd gebruikt of welk project het grootste deel van de dag in beslag nam.
Important
Controleer voordat u computergeschiedenis inschakelt de bewaartermijn, verwijderopties, uitgesloten applicaties, het synchronisatiegedrag, de toegang voor beheerders en of de gegevens worden gebruikt om toekomstige modellen te trainen.
Een bruikbaar geheugensysteem vraagt om selectieve vastlegging. Uitsluitingen voor applicaties, pauzeknoppen, lokale verwerking, korte bewaartermijnen en doorzoekbare verwijderopties zouden de afweging eenvoudiger maken.
Ook op andere fronten neemt de concurrentie rond privacy toe. Anthropic bouwt naar verluidt aan een systeem waarmee enterprise-klanten met zero data retention gegevens voor veiligheidsmonitoring zelf kunnen bewaren, in plaats van dat Anthropic prompts maximaal 30 dagen opslaat. Anthropic heeft via de aangeleverde bron nog geen details over het systeem gepubliceerd.
OpenAI werkt naar verluidt aan een vergelijkbaar model voor particuliere veiligheidsverwerking. Andere onbevestigde tests omvatten een afbeeldingssysteem met de naam Mona Lisa 1 en een Apple Messages-plugin voor ChatGPT op macOS.
Waarom dit belangrijk is: Computergeschiedenis kan uitgroeien tot een krachtig werkgeheugen, maar levert tegelijk een van de volledigste gedragsregistraties op die een assistent kan verzamelen.

Volgens de onderzoeksbriefing heeft Anthropic Claude Academy gelanceerd als gratis leerplatform. De cursussen lopen uiteen van introductiemateriaal tot praktische richtlijnen voor dagelijks gebruik.
Trainingsportalen zijn belangrijk, want de mogelijkheden van een model garanderen geen consistent gebruik. Een gezamenlijke cursus kan teams een gedeeld begrippenkader bieden voor prompting, documentverwerking, verificatie en veilige tooltoegang.
Anthropics gemelde systeem waarbij klanten zelf veiligheidsgegevens bewaren, richt zich op een lastiger enterprisevraagstuk. Klanten met zero data retention kunnen een dienst afwijzen als veiligheidsmonitoring alsnog vereist dat de provider prompts tijdelijk bewaart.
Opslag onder beheer van de klant biedt een mogelijk compromis. De provider kan waar nodig om veiligheidsbewijs vragen, terwijl de klant rechtstreeks zeggenschap houdt over de onderliggende gegevens.
Daar staat operationele verantwoordelijkheid tegenover. Klanten moeten mogelijk logs beveiligen, bewaartermijnen beheren, juridische verzoeken afhandelen en aantonen dat registraties niet zijn gewijzigd.
Waarom dit belangrijk is: De acceptatie van enterprisemodellen hangt steeds meer af van training, gegevensbeheer en auditcontroles, niet alleen van een leidende positie in benchmarks.
Begin hier
Voer vijf bestaande werkprompts uit met Ox Alpha via OpenRouter en beoordeel vervolgens nauwkeurigheid, latency, opmaak en naleving van instructies op een schaal van 1 tot 5.
Snel resultaat
Verdieping
Ox Alpha is het interessantste model van deze week door de combinatie van gratis toegang, een enorm contextvenster en een onbekende eigenaar. Over de herkomst wordt nog altijd gespeculeerd. Test de resultaten daarom zonder ervan uit te gaan dat toegang, licenties of verantwoordelijkheid van de provider stabiel blijven.
De minder opvallende productwijzigingen kunnen op langere termijn grotere gevolgen hebben. Onzichtbare watermerken verminderen de zichtbaarheid voor mensen, Drive-connectors verruimen de toegang tot documenten en computergeschiedenis vraagt gebruikers een gedetailleerd activiteitenoverzicht in te ruilen voor een beter geheugen.
Volgende week zijn vooral bekendmakingen over eigendom, documentatie over bewaartermijnen, reproduceerbare evaluaties en duidelijke lanceringsdatums van belang. De intelligentie van modellen doet ertoe, maar controle over bestanden, logs, herkomst en facturering wordt in de praktijk een steeds belangrijker onderscheidend criterium.