Terug naar de gidsen

Ox Alpha onthuld: het was GLM-5.3-Flash

Ox Alpha is niet langer een mysterie. Z.AI onthulde het stealth OpenRouter-model als GLM-5.3-Flash. Bekijk de tijdlijn, 1M-context, API-prijs en open gewichten.

Laatst bijgewerkt: 27 aug 2026Yix TeamYix Team
Ox Alpha onthuld: het was GLM-5.3-Flash

Ox Alpha is niet langer een anoniem AI-model. Z.AI onthulde in augustus 26, 2026 dat het stealth-model dat werd getest op OpenRouter en OpenCode een vroege versie was van GLM-5.3-Flash.

Die update verandert de manier waarop elke eerdere Ox Alpha-recensie moet worden gelezen. De gratis preview, anonieme provider en community-fingerprinting behoren tot het lanceringsverhaal. Het model dat beschikbaar is voor serieuze evaluatie heeft nu een officiële naam, documentatie, API-prijs, downloadbare gewichten en een licentie.

Hier is het korte antwoord: Ox Alpha was een openbare stresstest. GLM-5.3-Flash is het vrijgegeven product.

De Ox Alpha-tijdlijn

Op augustus 20 verscheen een model onder de ID stealth/ox-alpha. De vermelding beloofde een contextvenster van grofweg 1-miljoen token, zeer lange uitvoer, visuele invoer en een focus op codering en langlopende agenttaken. De toegang was gratis tijdens de stealth preview, terwijl de identiteit van de ontwikkelaar verborgen bleef.

De combinatie trok onmiddellijke belangstelling. Ontwikkelaars testten het codeergedrag, vergeleken tokenisatiepatronen en probeerden de modelfamilie te identificeren. Dat werk was suggestief, geen bewijs. Een anoniem eindpunt kan de routering of configuratie ervan wijzigen, en zelfidentificatieprompts zijn notoir onbetrouwbaar.

Zes dagen later besliste Z.AI de kwestie. In de GLM-5.3-Flash launch post staat dat het bedrijf het model anoniem heeft getest als Ox Alpha op OpenCode en OpenRouter om feedback te verzamelen voordat het wordt uitgebracht. Bloomberg's rapport, opnieuw gepubliceerd door Yahoo Finance, vermeldde ook de bevestiging van Z.AI.

Het onderscheid tussen preview en release is nog steeds van belang. Ox Alpha was een vroege build en een tijdelijke serviceconfiguratie. De resultaten van die week vormen een nuttig bewijs van het gedrag onder echt verkeer, maar mogen niet worden beschouwd als een permanente prijs, een belofte op het gebied van serviceniveau of een exacte meting van het uiteindelijke model.

Wat GLM-5.3-Flash is

GLM-5.3-Flash is het eerste native multimodale model in de GLM-5-familie. De officiële modelkaart vermeldt het totale aantal 320-parameters waarbij het 18-miljard tegelijk is geactiveerd.

Z.AI zegt dat het een nieuw basismodel heeft getraind op een multimodaal corpus met 30-biljoen-token. De architectuur combineert spaarzame aandacht met lineaire aandacht en voegt Manifold-Constrained Hyper-Connections toe. In gewone taal: het model heeft een grote totale capaciteit, maar is ontworpen om een ​​kleinere actieve slice te gebruiken en de kosten voor het verwerken van lange reeksen te verlagen.

De officiële API ondersteunt een 1-miljoen-token contextvenster. Beeldinvoer wordt toegevoegd als image_url-inhoudsblokken, met een externe URL of een basis64-gegevens-URL. Er kunnen meerdere afbeeldingen in één bericht worden opgenomen. De visuele mogelijkheden van het model zijn bedoeld om binnen de coderings- en agentlus te leven, zodat het een interface of weergegeven uitvoer kan inspecteren en vervolgens zijn werk kan herzien.

Dit is een redeneer- en begripsmodel. Het voert tekst uit; het is geen beeld- of videogenerator.

Ox Alpha-prijs na de onthulling

De gratis Ox Alpha-week was een preview-aanbieding, niet de permanente commerciële prijs. De officiële Z.AI-prijspagina vermeldt GLM-5.3-Flash op:

TokentypeCatalogusprijs per 1MActieprijs per 1M
Invoer$0.15$0.075
Gecachte invoer$0.03$0.015
Uitvoer$0.50$0.25

De 50%-promotie eindigt naar verwachting op 24:00 op september 9, 2026, UTC+8. De catalogusprijs is de veiligere basis voor een langetermijnbegroting. Als een externe marktplaats een ander tarief aanbiedt, gebruik dan de prijs en voorwaarden voor die route in plaats van aan te nemen dat de directe API-prijs van Z.AI van toepassing is.

Tegen de catalogusprijs is het model veel goedkoper dan het volledige GLM-5.3-eindpunt, dat Z.AI vermeldt op $1.40 per miljoen invoertokens en $4.40 per miljoen uitvoertokens. De kosten zijn slechts een onderdeel van de beslissing: nieuwe pogingen, agentloops, enorme contexten en uitgebreide redeneringen kunnen nog steeds de rekening domineren.

Open gewichten en zelfhosting

Z.AI publiceerde de GLM-5.3-Flash-gewichten op Hugging Face onder de MIT-licentie. Officiële weergaveopties zijn onder meer SGLang, vLLM en KTransformers.

Open gewichten maken inspectie, privé-implementatie en aanpassing van gevolgtrekkingen mogelijk. Ze maken er geen klein lokaal model van. Een 320B-parameter-mix-van-experts-model moet nog steeds de volledige gewichten opslaan of ontladen, plus KV-cache, de vision-stack en runtime-overhead. Het actieve cijfer 18B beschrijft de berekening per token, niet de totale download- of geheugenvoetafdruk.

Voor de meeste ontwikkelaars is de API de verstandige eerste evaluatieroute. Self-hosting wordt aantrekkelijk wanneer langdurig gebruik, datalocatie, aangepaste kernels of onderzoekstoegang een substantiële gevolgtrekking rechtvaardigen.

Wat de benchmarks wel en niet bewijzen

Z.AI rapporteert sterke resultaten voor codering, agenttaken en visie, inclusief winst ten opzichte van GLM-5.2 en prestaties in de buurt van grotere eigen modellen op geselecteerde tests. Deze cijfers zijn nuttig, maar worden door de leverancier gerapporteerd en zijn afhankelijk van een specifiek harnas, toolconfiguratie, contextstrategie en bemonsteringsconfiguratie.

De betere vraag is of GLM-5.3-Flash uw werk betrouwbaar voltooit. Bouw een kleine evaluatie op van taken die u al begrijpt:

  • een repositorybug repareren en de tests uitvoeren;
  • inspecteer een screenshot en identificeer de daadwerkelijke mislukte status;
  • wijzig een kleine interface en vergelijk vervolgens het weergegeven resultaat met het verzoek;
  • beantwoord een vraag in een lang document met geciteerd bewijsmateriaal;
  • herhaal een uit meerdere stappen bestaande agenttaak om de consistentie te meten.

Registreer de totale tijd, tokengebruik, correcties en definitieve acceptatie. Een model dat per token goedkoop is, kan nog steeds duur zijn als het drie pogingen kost of stilletjes defecten introduceert.

Moet je nog steeds de naam Ox Alpha gebruiken?

Gebruik Ox Alpha bij het bespreken van de stealth-test, de ontdekking ervan of zoekopdrachten die tijdens die week zijn gemaakt. Gebruik GLM-5.3-Flash voor de huidige API-integratie, modelkaarten, implementatie en prijzen.

Deze naamgevingskeuze is meer dan redactionele netheid. Code die is gebouwd op basis van een tijdelijke stealth/ox-alpha-route werkt mogelijk niet meer of behoudt preview-aannames. Nieuwe integraties moeten de gedocumenteerde glm-5.3-flash-model-ID van Z.AI of de huidige genoemde lijst van de geselecteerde marktplaats gebruiken.

Als u tijdens de anonieme periode gevoelige of productiegegevens hebt verwerkt, bekijk dan de voorwaarden en logboeken die op dat moment van toepassing waren. Een gratis, niet-toegeschreven voorbeeld is geschikt voor openbare of synthetische evaluatiegegevens; het is een slechte standaard voor materiaal dat een bekende verwerker en contractuele controles vereist.

Waar het past naast beeldhulpmiddelen

GLM-5.3-Flash kan afbeeldingen inspecteren als onderdeel van een coderings- of redeneerlus, maar genereert geen afbeeldingen op Yix. Zie de Yix AI-modelmap voor visuele creatie. Om een ​​referentieafbeelding om te zetten in een herbruikbare generatieprompt, gebruikt u de gratis Image to Prompt Generator.

Het verschil is simpel: GLM-5.3-Flash beantwoordt vragen over visuele invoer; De creatieve tools van Yix helpen bij het produceren van de volgende afbeelding.

Kortom

Het mysterie rond Ox Alpha is voltooid. Het was Z.AI's vroege GLM-5.3-Flash, minder dan een week anoniem getest vóór de officiële release.

Het vrijgegeven model heeft een geloofwaardige praktische toonhoogte: native multimodale input, een 1M-contextvenster, lage API-prijzen, open gewichten onder MIT en een ontwerp gericht op codering en agenten met een lange horizon. De enorme totale omvang maakt zelfhosting tot een serieuze infrastructuurbeslissing, en de benchmarkclaims moeten nog steeds worden gevalideerd voor uw taken.

Evalueer glm-5.3-flash, niet de legende van een gratis stealth-eindpunt. De onthulling maakte het model minder mysterieus – en veel gemakkelijker om op verantwoorde wijze te beoordelen.

Gerelateerde handleidingen voor snelle modellen

Voor een andere open- versus gehoste modelverdeling vergelijkt u Qwen3.8 Flash met Flash-Next. Voor een snelle multimodale API gericht op beeldbegrip en OCR, lees de DeepSeek V4 Flash Vision Exp guide.

Bronnen: Z.AI-lanceringspost, Z.AI API-gids, Z.AI-prijzen, officiële modelkaart en Bloomberg via Yahoo Finance.

Ox Alpha en GLM zijn namen die door hun respectievelijke eigenaren worden gebruikt. Yix is niet aangesloten bij Z.AI, OpenRouter of OpenCode.