Ce qu'il faut retenir
- Ox Alpha était la preview anonyme de GLM-5.3-Flash : architecture MoE de 320 milliards de paramètres, 18 milliards actifs par token, poids ouverts sous licence MIT.
- À 0,15 $ le million de tokens en entrée et 0,50 $ en sortie, Z.ai attaque le prix des modèles multimodaux propriétaires avec un contexte proche du million de tokens.
- Les scores diffusés viennent de l'éditeur : un test communautaire mesure 58,4 % sur DeepSWE, loin des 80 % relayés pendant la phase stealth.
Résumé généré par IA
Apparu anonymement sur OpenRouter le 20 août 2026 sous le nom stealth/ox-alpha, Ox Alpha était en réalité GLM-5.3-Flash, le nouveau modèle multimodal de Z.ai. Le laboratoire chinois a levé le voile lors de la sortie officielle du modèle le 26 août. Au programme : 320 milliards de paramètres, dont 18 milliards actifs par token, un contexte pouvant atteindre environ un million de tokens, des poids ouverts sous licence MIT et un tarif catalogue particulièrement agressif de 0,15 $ par million de tokens en entrée et 0,50 $ en sortie.
Pendant près d’une semaine, personne ne savait officiellement qui se cachait derrière Ox Alpha. Le modèle apparaissait sur OpenRouter comme un modèle « stealth », gratuit pendant sa phase de test, et se distinguait surtout par ses capacités en programmation, en raisonnement agentique et par une fenêtre de contexte inhabituelle.
La réponse est désormais connue : Ox Alpha était la version de preview de GLM-5.3-Flash de Z.ai, anciennement connu sous le nom de Zhipu AI. Plus qu’un simple changement de nom, cette révélation montre comment les laboratoires d’IA testent désormais leurs modèles directement auprès des utilisateurs avant même de dévoiler leur identité.
Ox Alpha, c’était quoi exactement ?
Le 20 août 2026, un nouveau modèle baptisé stealth/ox-alpha apparaît sur OpenRouter. La plateforme le présente alors comme un modèle de raisonnement conçu pour le codage, les tâches agentiques longues et les usages en production.
Le fournisseur reste volontairement anonyme. OpenRouter sert uniquement d’intermédiaire entre les utilisateurs et l’entreprise qui exploite le modèle.
Plusieurs caractéristiques attirent immédiatement l’attention :
- une fenêtre de contexte annoncée à 1 048 576 tokens ;
- jusqu’à 131 072 tokens de sortie sur la configuration observée pendant la preview ;
- la prise en charge du texte, des images et de la vidéo en entrée ;
- un accès gratuit pendant la phase de test ;
- un positionnement clairement orienté vers le code et les agents IA.
Un modèle gratuit, multimodal et capable de manipuler un contexte d’environ un million de tokens avait forcément de quoi susciter la curiosité.
Pourquoi Ox Alpha a rapidement attiré l’attention
La phase anonyme n’a duré que quelques jours, mais elle a suffi pour faire d’Ox Alpha l’un des modèles les plus commentés de la semaine dans la communauté IA.
OpenCode, un agent de programmation open source, l’a notamment proposé gratuitement pendant la période de preview. Des développeurs ont commencé à l’utiliser sur des tâches de génération de code, de correction de bugs ou d’exécution de workflows agentiques relativement longs.
Plusieurs personnalités de la tech l’ont également testé publiquement, contribuant à alimenter les spéculations autour de son origine.
En parallèle, une véritable enquête communautaire s’est mise en place. Des utilisateurs ont comparé son comportement avec celui de modèles existants : tokenizer, structure des réponses, messages d’erreur, capacités multimodales ou encore comportement sur les tâches de programmation.
Très vite, une piste revient régulièrement : la famille GLM de Z.ai.
Z.ai révèle finalement GLM-5.3-Flash
Le 26 août 2026, le mystère prend fin avec la sortie officielle de GLM-5.3-Flash.
Z.ai confirme avoir testé le modèle anonymement sous le nom Ox Alpha sur OpenRouter et OpenCode avant son lancement public. L’objectif était de confronter le modèle à des usages réels et d’obtenir des retours sans que la réputation du laboratoire ou de la famille GLM influence les utilisateurs.
Cette stratégie transforme la phase de preview en véritable test grandeur nature.
Autre détail important : Z.ai affirme avoir servi le trafic de cette période sur une infrastructure reposant sur des accélérateurs IA chinois, sans utiliser de GPU Nvidia pour ce trafic. Le message dépasse donc largement la simple présentation d’un nouveau modèle : Z.ai cherche également à démontrer sa capacité à entraîner et surtout à servir un LLM de grande taille sur une infrastructure technologique domestique.
GLM-5.3-Flash : 320 milliards de paramètres, mais seulement 18 milliards actifs
GLM-5.3-Flash repose sur une architecture Mixture of Experts (MoE). Le modèle compte environ 320 milliards de paramètres au total, mais seulement 18 milliards sont activés pour chaque token.
Ce fonctionnement permet de conserver une grande capacité globale tout en réduisant le volume de calcul nécessaire à chaque étape de génération.
Z.ai présente également GLM-5.3-Flash comme le premier modèle nativement multimodal de la série GLM-5. Il est entraîné pour traiter conjointement du texte et des informations visuelles, avec une prise en charge du texte, des images, de la vidéo et de différents types de fichiers selon les environnements d’utilisation.
Le laboratoire introduit par ailleurs une architecture hybride combinant attention sparse et attention linéaire, pensée pour limiter le coût du calcul sur les contextes très longs.
Les principales caractéristiques de GLM-5.3-Flash
| Caractéristique | GLM-5.3-Flash |
|---|---|
| Développeur | Z.ai |
| Nom pendant la preview | Ox Alpha |
| Architecture | Mixture of Experts (MoE) |
| Paramètres totaux | 320 milliards |
| Paramètres actifs | 18 milliards par token |
| Modalités | Texte, image, vidéo |
| Fenêtre de contexte | Jusqu’à environ 1 million de tokens |
| Sortie maximale observée sur OpenRouter | Jusqu’à 131 072 tokens |
| Licence des poids | MIT |
| Identifiant OpenRouter | z-ai/glm-5.3-flash |
| Tarif catalogue | 0,15 $ / 1M tokens en entrée, 0,50 $ en sortie |
Les poids du modèle sont publiés sur Hugging Face sous licence MIT, ce qui permet aux développeurs et aux entreprises de les télécharger, de les étudier et de déployer leurs propres instances selon leurs contraintes techniques.
Les performances de GLM-5.3-Flash sont-elles vraiment au niveau des meilleurs modèles ?
C’est probablement le point qui a généré le plus de confusion pendant la période Ox Alpha.
Un chiffre de 80 % sur DeepSWE a notamment beaucoup circulé sur les réseaux et dans certaines discussions communautaires. Ce score ne correspond toutefois pas au benchmark officiel publié par Z.ai et ne doit pas être repris comme une performance établie sans préciser sa méthodologie.
Dans ses propres évaluations, Z.ai annonce notamment :
- 63,4 sur DeepSWE v1.1 ;
- 84,3 sur Terminal Bench 2.1 ;
- 56,3 sur NL2Repo ;
- 78,4 sur Toolathlon Verified.
Ces chiffres restent des benchmarks publiés par le fournisseur. Ils donnent une indication sur le positionnement du modèle, mais ne remplacent pas des évaluations indépendantes réalisées dans des conditions identiques entre plusieurs LLM.
Un test communautaire séparé réalisé sur 113 tâches DeepSWE a par exemple obtenu 58,4 % de tâches résolues. La différence illustre bien pourquoi il faut éviter de comparer directement des scores provenant de protocoles différents.
Pour suivre son positionnement face aux autres modèles récents, notre classement des meilleurs LLM est mis à jour régulièrement à partir de données de benchmarks indépendants.
Un modèle particulièrement agressif sur le prix
La stratégie de Z.ai ne repose pas uniquement sur les performances.
Le tarif catalogue de GLM-5.3-Flash est annoncé à :
- 0,15 $ par million de tokens en entrée ;
- 0,50 $ par million de tokens en sortie.
Les prix réellement facturés peuvent toutefois varier selon le fournisseur d’inférence, les promotions temporaires ou le routage utilisé par OpenRouter.
Ce positionnement est particulièrement agressif pour un modèle multimodal de cette taille et constitue probablement l’un de ses principaux arguments face aux modèles propriétaires de ChatGPT, Claude ou Gemini.
Pour comparer plus largement les différentes familles de modèles, notre comparatif ChatGPT vs Claude vs Gemini vs Mistral détaille leurs principaux écarts de positionnement.
Que devient l’identifiant stealth/ox-alpha ?
Ox Alpha était avant tout un nom de preview.
Pour une nouvelle intégration, il est préférable d’utiliser l’identifiant officiel du modèle :
z-ai/glm-5.3-flash
sur OpenRouter, ou glm-5.3-flash via les services compatibles de Z.ai.
Une application qui dépend encore de stealth/ox-alpha doit donc être mise à jour. Les identifiants temporaires utilisés pendant les lancements anonymes ne doivent pas être considérés comme des API stables sur lesquelles construire une dépendance de production à long terme.
Ox Alpha montre surtout l’intérêt des lancements « stealth »
L’histoire d’Ox Alpha est intéressante au-delà de GLM-5.3-Flash lui-même.
Les laboratoires d’IA disposent désormais de plateformes capables de mettre un nouveau modèle entre les mains de milliers de développeurs sans révéler immédiatement son origine. Cela permet de mesurer son comportement sur de vraies requêtes, de détecter des problèmes et de recueillir des retours avant une annonce officielle.
L’approche présente aussi un avantage marketing évident : le mystère génère de la curiosité, des comparaisons et des discussions autour du modèle.
Mais elle rappelle également une règle importante pour les développeurs et les entreprises : un modèle stealth gratuit doit être considéré comme une expérimentation, pas comme une infrastructure de production garantie.
Tant que son fournisseur, sa politique tarifaire, ses conditions d’utilisation et son identifiant définitif ne sont pas connus, mieux vaut éviter d’en faire une dépendance critique.
Dans le cas d’Ox Alpha, le pari a plutôt réussi à Z.ai. Le modèle a bénéficié de plusieurs jours de tests et de discussions avant même que son véritable nom ne soit dévoilé. Avec GLM-5.3-Flash, le laboratoire chinois cherche désormais à convertir cette curiosité en adoption durable grâce à trois arguments : multimodalité, contexte long et coût d’inférence réduit.
FAQ
Ox Alpha était le nom anonyme utilisé pour tester GLM-5.3-Flash sur OpenRouter et OpenCode avant son lancement officiel.
Ox Alpha a été développé par Z.ai, le laboratoire chinois auparavant connu sous le nom de Zhipu AI.
Oui. Z.ai a confirmé que GLM-5.3-Flash avait été testé anonymement sous le nom Ox Alpha avant sa sortie publique.
Ses poids sont publiés sous licence MIT. Il est donc plus précis de parler de modèle à poids ouverts que de simplement le qualifier d’open source sans nuance.
Son tarif catalogue est de 0,15 $ par million de tokens en entrée et 0,50 $ en sortie. Des promotions ou des tarifs différents peuvent être proposés selon le fournisseur.
Le modèle peut atteindre environ 1 048 576 tokens de contexte, soit un peu plus d’un million de tokens.

