Ox Alpha dévoilé : il s’agissait de GLM-5.3-Flash
Ox Alpha n'est plus un mystère. Z.AI a révélé le modèle furtif OpenRouter sous le nom de GLM-5.3-Flash. Consultez la chronologie, le contexte 1M, le prix de l'API et les pondérations ouvertes.

Ox Alpha n'est plus un modèle d'IA anonyme. Z.AI a révélé en août 26, 2026 que le modèle furtif testé sur OpenRouter et OpenCode était une première version de GLM-5.3-Flash.
Cette mise à jour modifie la façon dont chaque critique précédente d'Ox Alpha doit être lue. L'aperçu gratuit, le fournisseur anonyme et les empreintes digitales communautaires font partie de l'histoire de lancement. Le modèle disponible pour une évaluation sérieuse a désormais un nom officiel, une documentation, un prix API, des poids téléchargeables et une licence.
Voici la réponse courte : Ox Alpha était un test de résistance public. GLM-5.3-Flash est le produit lancé.
La chronologie du Bœuf Alpha
En août 20, un modèle est apparu sous l'ID stealth/ox-alpha. Sa liste promettait une fenêtre contextuelle d'environ un million de jetons 1, une sortie très longue, une entrée visuelle et une concentration sur le codage et les tâches d'agent de longue durée. L'accès était gratuit lors de la prévisualisation furtive, tandis que l'identité du développeur restait cachée.
La combinaison a suscité un intérêt immédiat. Les développeurs ont testé son comportement de codage, comparé les modèles de tokenisation et tenté d'identifier la famille de modèles. Ce travail était suggestif, pas une preuve. Un point de terminaison anonyme peut modifier son routage ou sa configuration, et les invites d'auto-identification sont notoirement peu fiables.
Six jours plus tard, Z.AI règle la question. Son article de lancement GLM-5.3-Flash indique que la société a testé le modèle de manière anonyme sous le nom d'Ox Alpha sur OpenCode et OpenRouter pour recueillir des commentaires avant sa sortie. Le rapport de Bloomberg, republié par Yahoo Finance, rapportait également la confirmation de Z.AI.
La distinction entre aperçu et version est toujours importante. Ox Alpha était une première version et une configuration de service temporaire. Les résultats de cette semaine constituent une preuve utile du comportement dans un trafic réel, mais ils ne doivent pas être traités comme un prix permanent, une promesse de niveau de service ou une mesure exacte du modèle final.
Qu'est-ce que le GLM-5.3-Flash ?
GLM-5.3-Flash est le premier modèle nativement multimodal de la famille GLM-5. La carte de modèle officielle répertorie les milliards de paramètres totaux 320 avec les milliards 18 activés à la fois.
Z.AI affirme avoir formé un nouveau modèle de base sur un corpus multimodal 30 contenant des milliards de jetons. L'architecture combine une attention clairsemée avec une attention linéaire et ajoute des hyper-connexions à contraintes multiples. En langage clair, le modèle a une grande capacité totale mais est conçu pour utiliser une tranche active plus petite et pour réduire le coût de traitement de longues séquences.
L'API officielle prend en charge une fenêtre contextuelle d'un million de jetons 1. L'entrée d'image est ajoutée sous forme de blocs de contenu image_url, soit avec une URL externe, soit avec une URL de données base64. Plusieurs images peuvent être incluses dans un seul message. Les capacités visuelles du modèle sont destinées à vivre à l'intérieur de sa boucle de codage et d'agent, afin qu'il puisse inspecter une interface ou une sortie rendue, puis réviser son travail.
Il s’agit d’un modèle de raisonnement et de compréhension. Il génère du texte ; ce n'est pas un générateur d'images ou de vidéos.
Prix du Ox Alpha après la révélation
La semaine gratuite Ox Alpha était une offre d’avant-première, et non le prix commercial permanent. La [page de tarification Z.AI] officielle (https://docs.z.ai/guides/overview/pricing) répertorie GLM-5.3-Flash à l'adresse :
| Type de jeton | Prix catalogue par 1M | Prix promotionnel par 1M |
|---|---|---|
| Entrée | $0.15 | $0.075 |
| Entrée en cache | $0.03 | $0.015 |
| Sortie | $0.50 | $0.25 |
La promotion 50% devrait se terminer à 24:00 en septembre 9, 2026, UTC+8. Le prix catalogue constitue la base la plus sûre pour un budget à long terme. Si un marché tiers propose un tarif différent, utilisez le prix et les conditions de cet itinéraire plutôt que de supposer que le prix API direct de Z.AI s'applique.
Au prix catalogue, le modèle est beaucoup moins cher que le point de terminaison complet GLM-5.3, que Z.AI répertorie à $1.40 par million de jetons d'entrée et à $4.40 par million de jetons de sortie. Le coût n’est qu’une partie de la décision : les nouvelles tentatives, les boucles d’agents, les contextes énormes et les raisonnements détaillés peuvent toujours dominer la facture.
Poids ouverts et auto-hébergement
Z.AI a publié les poids GLM-5.3-Flash sur Hugging Face sous la licence MIT. Les options de diffusion officielles incluent SGLang, vLLM et KTransformers.
Les pondérations ouvertes rendent possibles l’inspection, le déploiement privé et la personnalisation des inférences. Ils n’en font pas un petit modèle local. Un modèle combinant des experts et des paramètres 320B doit toujours stocker ou décharger les poids complets, ainsi que le cache KV, la pile de vision et la surcharge d'exécution. La figure active 18B décrit le calcul par jeton, et non le téléchargement total ou l'empreinte mémoire.
Pour la plupart des développeurs, l’API constitue la première voie d’évaluation judicieuse. L'auto-hébergement devient attrayant lorsqu'une utilisation soutenue, l'emplacement des données, les noyaux personnalisés ou l'accès à la recherche justifient une configuration d'inférence substantielle.
Ce que font et ne prouvent pas les benchmarks
Z.AI rapporte d'excellents résultats en matière de codage, de tâches d'agent et de vision, notamment des gains par rapport au GLM-5.2 et des performances proches de modèles propriétaires plus grands sur des tests sélectionnés. Ces chiffres sont utiles, mais ils sont signalés par le fournisseur et dépendent d'un harnais spécifique, de la configuration de l'outil, de la stratégie contextuelle et de la configuration d'échantillonnage.
La meilleure question est de savoir si le GLM-5.3-Flash termine votre travail de manière fiable. Construisez une petite évaluation à partir de tâches que vous comprenez déjà :
- corriger un bug du référentiel et exécuter les tests ;
- inspectez une capture d'écran et identifiez l'état de défaillance réel ;
- modifier une petite interface, puis comparer le résultat rendu avec la requête ;
- répondre à une question à travers un long document avec des preuves citées ;
- répétez une tâche d'agent en plusieurs étapes pour mesurer la cohérence.
Enregistrez le temps total, l'utilisation des jetons, les corrections et l'acceptation finale. Un modèle bon marché par jeton peut toujours être coûteux s'il nécessite trois tentatives ou s'il introduit silencieusement des défauts.
Devez-vous toujours utiliser le nom Ox Alpha ?
Utilisez Ox Alpha lorsque vous discutez du test de furtivité, de sa découverte ou des requêtes de recherche créées au cours de cette semaine. Utilisez GLM-5.3-Flash pour l'intégration actuelle de l'API, les cartes modèles, le déploiement et les tarifs.
Ce choix de dénomination va au-delà de la simple précision rédactionnelle. Le code construit sur un itinéraire temporaire stealth/ox-alpha peut cesser de fonctionner ou conserver les hypothèses d'aperçu. Les nouvelles intégrations doivent utiliser l'ID de modèle glm-5.3-flash documenté de Z.AI ou la liste nommée actuelle du marché sélectionné.
Si vous avez manipulé des données sensibles ou de production pendant la période d'anonymat, examinez les conditions et les journaux en vigueur à ce moment-là. Un aperçu gratuit et non attribué convient aux données d'évaluation publiques ou synthétiques ; il s'agit d'un mauvais défaut pour le matériel qui nécessite un processeur connu et des contrôles contractuels.
Où il s'intègre à côté des outils d'image
GLM-5.3-Flash peut inspecter les images dans le cadre d'une boucle de codage ou de raisonnement, mais il ne génère pas d'images sur Yix. Pour la création visuelle, consultez le Répertoire des modèles AI Yix. Pour transformer une image de référence en une invite de génération réutilisable, utilisez le Générateur d'image en invite gratuit .
La différence est simple : GLM-5.3-Flash répond aux questions sur la saisie visuelle ; Les outils créatifs du Yix aident à produire l'image suivante.
Conclusion
Le mystère autour d’Ox Alpha est terminé. Il s'agissait du premier GLM-5.3-Flash de Z.AI, testé de manière anonyme moins d'une semaine avant la sortie officielle.
Le modèle publié a un argumentaire pratique crédible : entrée multimodale native, une fenêtre contextuelle 1M, des prix d'API bas, des pondérations ouvertes sous MIT et une conception destinée au codage et aux agents à long horizon. Sa taille totale énorme fait de l’auto-hébergement une décision sérieuse en matière d’infrastructure, et ses affirmations de référence doivent encore être validées sur vos tâches.
Évaluez glm-5.3-flash, pas la légende d'un point de terminaison furtif gratuit. Cette révélation a rendu le modèle moins mystérieux et beaucoup plus facile à évaluer de manière responsable.
Guides de modèles rapides associés
Pour une répartition différente du modèle ouvert et hébergé, comparez Qwen3.8 Flash avec Flash-Next. Pour une API multimodale rapide axée sur la compréhension des images et l'OCR, lisez le guide DeepSeek V4 Flash Vision Exp.
Sources : article de lancement de Z.AI, guide de l'API Z.AI, tarifications Z.AI, carte de modèle officielle et Bloomberg via Yahoo Finance.
Ox Alpha et GLM sont des noms utilisés par leurs propriétaires respectifs. Yix n'est pas affilié à Z.AI, OpenRouter ou OpenCode.