The Specialty News
IA

Z.ai lance un modèle d'IA à $0.045 qui rivalise avec Claude — et la Silicon Valley pensait qu'il s'agissait de Google

En lançant discrètement GLM-5.3-Flash sous un pseudonyme, un laboratoire chinois a prouvé que l'intelligence de pointe peut tourner sur des puces nationales pour trois fois rien.

Par The Specialty News DeskÉdité par 4 min read
Z.ai lance un modèle d'IA à $0.045 qui rivalise avec Claude — et la Silicon Valley pensait qu'il s'agissait de Google
Photo: reuters.com

Pendant près d'une semaine en août, les développeurs de logiciels occidentaux étaient convaincus qu'un mystérieux modèle d'IA dominant les classements d'OpenRouter était une version fuitée de Gemini de Google. Capable de traiter un million de tokens à la fois, il était apparu de nulle part sous le pseudonyme d'Ox Alpha. Mais le modèle n'appartenait pas à Mountain View. Il a été conçu à Beijing, fonctionne entièrement sur des puces chinoises nationales, et vient de briser le plancher tarifaire de l'intelligence artificielle de pointe.

Le déguisement

Quand le modèle est arrivé sur OpenRouter, les spéculations allaient bon train sur une sortie secrète d'un géant de la tech occidental. Un groupe de chercheurs indépendants a ignoré les rumeurs. En interrogeant le modèle en chinois et en analysant ses taux de compression, ils ont découvert qu'il renvoyait des erreurs d'exception API exactes liées à Zhipu AI, un important laboratoire chinois.

Ce lancement discret était totalement intentionnel. En retirant son nom de la publication, Zhipu — opérant à l'échelle mondiale sous le nom de Z.ai — a contraint les développeurs occidentaux à évaluer le modèle uniquement sur ses mérites. Patrick Collison, PDG de Stripe, l'a testé très tôt et a publiquement qualifié le code de très impressionnant, validant l'architecture avant même que quiconque n'en connaisse l'origine.

Le piège a parfaitement fonctionné. L'internet chinois a célébré ce démasquage, mais les directions financières des entreprises aux US font désormais face à un problème bien plus important.

Le paradigme à dix centimes

Le paradigme à dix centimes
Photo: reuters.com

Le modèle démasqué, GLM-5.3-Flash, introduit une architecture de 320-billion de paramètres qui ne repose que sur 18 billion de paramètres actifs lors de l'inférence. Z.ai a publié les poids sous licence open source MIT et a annoncé des tarifs entreprise très réduits à 15 cents par million de tokens d'entrée.

Pour mettre en perspective la référence de $0.045 par tâche, cela représente environ un effondrement des prix de 10x pour ce niveau spécifique de raisonnement. C'est l'équivalent de découvrir qu'un menu dégustation étoilé au guide Michelin coûte désormais exactement le même prix qu'une barre chocolatée de distributeur automatique.

Les enjeux géopolitiques sont tout aussi brûlants. Z.ai affirme fournir une capacité allant jusqu'à 100 trillion de tokens par jour entièrement sur du matériel produit localement. Ils ont prouvé que les performances d'IA de premier plan peuvent se déployer à l'échelle mondiale sans dépendre des puces occidentales les plus récentes. Mais faire tourner des modèles de pointe à bas coût cache un piège opérationnel de taille.

Z.ai's Stealth AI Breaks Price Floor

A visual summary of this story

The Brief

Restez curieux

IA et technologie : ce qui change et pourquoi cela compte.
Votre sélection quotidienne, en anglais ou en espagnol.

Gratuit pour toujours. Désabonnement à tout moment.

Conversation

Lancer la conversation

Aucun compte requis. Les commentaires sont vérifiés automatiquement — restez courtois.

Plus d'articles

Continuer la lecture