The Specialty News
IA

OpenAI retarde GPT Astra face à des rivaux secrets qui traitent des milliers de milliards de tokens

Alors qu'OpenAI suspend son modèle Astra, capable de résoudre des problèmes mathématiques, en raison de cyber-risques, un modèle chinois secret vient de traiter gratuitement 9,4 billions de tokens.

Par The Specialty News DeskÉdité par 4 min read
Photo: medium.com

Le secteur de l'intelligence artificielle vient de vivre une semaine de vertige. Entre des modèles secrets anonymes traitant gratuitement des milliers de milliards de tokens, des fuites d'API accidentelles chez Anthropic et des percées dans le raisonnement mathématique de niveau doctorat, le paysage connaît un bond massif et simultané. C'est le «moment haut débit» pour l'intelligence machine.

La démonstration de force à 9,4 billions de tokens

La communauté tech est obsédée par «Ox Alpha», un modèle secret qui a cassé les prix de tout le marché en offrant des capacités de pointe et une fenêtre de contexte de 1 million de tokens pour exactement zéro dollar.

Plutôt que d'attendre un communiqué de presse d'entreprise, des développeurs ont rétro-conçu le modèle. En mesurant les réponses du tokenizer dans des dizaines de langues, des analystes ont découvert un décalage constant de +75 tokens.

Tous les autres modèles dérivent. Ce 75 est un prompt système caché, et la trace de raisonnement indique à quoi il sert: «selon le prompt système, si on m'interroge sur mon identité, je réponds ox-alpha».PromptEngineer48

Cette particularité correspond parfaitement à l'architecture de prompt système caché de la famille GLM-5.3 de Zhipu AI. Le consensus est clair: Ox Alpha est un test de résistance pour GLM-5.3 Flash, représentant une démonstration de force massive des capacités d'infrastructure chinoises visant directement l'écosystème mondial des développeurs. Alibaba s'est simultanément jeté dans la mêlée en publiant Qwen 3.8-Flash-Next en tant qu'aperçu structurel de Qwen 4. Il atteint une efficacité de routage extrême en n'activant que 6 milliards de ses 125 milliards de paramètres par token.

La fuite accidentelle «Marshmallow» d'Anthropic

Alors que les champions de l'open-weight inondent le marché de puissance de calcul gratuite, les hyperscalers occidentaux se démènent pour perfectionner leurs fleurons de pointe. Anthropic a sorti Claude Opus 5 en juillet, mais l'entreprise a franchement admis que les performances du modèle étaient «irrégulières».

Cette semaine, la découverte d'identifiants de modèles non annoncés—claude-marshmallow-eap et claude-melon-eap—a fuité dans les interfaces d'API. Ceux-ci pointent vers un perfectionnement d'urgence imminent à mi-parcours.

Comme ces identifiants utilisent la balise Early Access Preview—le marqueur exact utilisé pour Opus 5 des semaines avant son lancement—les développeurs s'attendent à ce qu'Opus 5.1 et une nouvelle variante de Haiku ou de Sonnet sortent d'un instant à l'autre. L'époque où l'on attendait un an pour une mise à jour majeure de modèle est révolue; nous sommes désormais dans un cycle d'itération continue et en conditions réelles.

Le prodige des maths à 2 000 $ mis sur la touche

Le développement le plus marquant de la semaine n'est pas ce qui a été lancé, mais ce qui ne l'a pas été. Le modèle GPT Astra d'OpenAI, dont la sortie a été retardée, aurait résolu 10 problèmes mathématiques non résolus depuis des décennies—y compris l'empilement de sphères en dimensions supérieures—en utilisant moins de 2 000 $ de puissance de calcul.

Astra n'a pas accompli cela uniquement par la force brute. Il a utilisé des frameworks mathématiques établis comme Lean pour combiner nativement la découverte avec une vérification automatisée étape par étape. Cela transforme l'IA, qui passe d'un générateur de texte stochastique à un partenaire de recherche vérifiable, capable d'accélérer la physique et la science des matériaux.

But la sortie du modèle reste strictement suspendue. Lors des tests de sécurité, Astra a manifesté des capacités de cybersécurité autonomes qu'OpenAI n'a pas pu exclure comme étant critiques. Alors que les modèles franchissent le seuil du codage agentique, le risque d'exploits zero-day automatisés a déclenché des cadres de test gouvernementaux volontaires.

Bienvenue dans l'ère du haut débit de l'IA

Ce à quoi nous assistons est une guerre par procuration avec deux fronts distincts. Des challengers comme Alibaba et Zhipu AI banalisent le contexte extrême pour faire de leurs architectures le socle par défaut des startups du monde entier. Pendant ce temps, les défenseurs de la frontière technologique comme OpenAI et Anthropic repoussent le plafond absolu de l'intelligence, quitte à retarder le lancement de produits pour prévenir des cyber-catastrophes géopolitiques.

C'est le moment haut débit de l'IA. Il y a tout juste trois ans, les fenêtres de contexte étaient limitées à quelques milliers de tokens, étroitement mesurées et coûteuses—un peu comme à l'époque de l'internet bas débit.

Aujourd'hui, un laboratoire anonyme peut mettre en ligne un modèle doté d'un contexte de 1 million et traiter gratuitement des milliers de milliards de tokens juste pour tester ses serveurs. Alors que l'infrastructure de l'intelligence passe rapidement d'un luxe rare à un service public omniprésent, l'opportunité ne réside plus dans la fourniture de puissance de calcul, mais dans ce que nous pouvons construire sur une cognition infinie et gratuite.

The AI Proxy War: Two Fronts

A visual summary of this story

The Brief

Restez curieux

IA et technologie : ce qui change et pourquoi cela compte.
Votre sélection quotidienne, en anglais ou en espagnol.

Gratuit pour toujours. Désabonnement à tout moment.

Conversation

Lancer la conversation

Aucun compte requis. Les commentaires sont vérifiés automatiquement — restez courtois.

Plus d'articles

Continuer la lecture