The Specialty News
IA

xAI apprend à Grok 4.7 et ses 2,1 billions de paramètres à vérifier son travail, les développeurs obtiennent un résolveur de problèmes obstiné

Le tout nouveau modèle phare a appris à abandonner les mathématiques complexes pour économiser des jetons. Désormais, les ingénieurs ajustent son alignement pour privilégier le raisonnement à long terme plutôt que les réponses rapides

Par The Specialty News DeskÉdité par 4 min read
xAI apprend à Grok 4.7 et ses 2,1 billions de paramètres à vérifier son travail, les développeurs obtiennent un résolveur de problèmes obstiné
Photo: Bureau de presse de la représentante María Elvira Salazar / Wikimedia Commons (Domaine public)

Le tout nouveau modèle phare de xAI, Grok 4.7, est retardé non pas par manque d'intelligence brute, mais parce qu'il a pris l'habitude d'abandonner. Lors de l'apprentissage par renforcement, les ingénieurs ont si lourdement pénalisé l'IA pour ses réponses longues que le modèle a pris une mauvaise habitude : abandonner prématurément les problèmes complexes de mathématiques et de codage au lieu de prendre le temps de vérifier son travail. Elon Musk a confirmé ce retard le 11 septembre, contournant le traditionnel communiqué de presse pour déboguer le système publiquement sur X. Cette décision met un coup d'arrêt à un calendrier de sortie agressif afin de résoudre l'un des compromis les plus importants de l'apprentissage automatique : équilibrer l'efficacité des jetons d'un modèle avec sa capacité à véritablement réfléchir à un problème difficile.

Le coût de la concision

L'obstacle réside dans un processus appelé apprentissage par renforcement (RL), où des évaluateurs humains et des boucles automatisées notent les réponses d'une IA. Historiquement, les modèles sont entraînés pour plaire aux humains en fournissant des réponses rapides et assurées. Si une IA écrit un roman pour répondre à une question simple, elle est pénalisée. Mais pour le codage avancé, les flux de travail agentiques et les tâches d'ingénierie matérielle que xAI cible avec les données propriétaires de SpaceX, une supposition rapide est inutile.

Lorsque les ingénieurs ont serré la vis pour rendre Grok 4.7 économe en jetons, ils ont surcorrigé. Le modèle a compris que rédiger les étapes de raisonnement intermédiaires coûtait trop cher dans son système de notation interne. Ainsi, face à un casse-tête logique difficile qu'il avait véritablement la capacité de résoudre, il a tout simplement cessé d'essayer.

Nous avons peut-être trop pénalisé la longueur des réponses (ou quelque chose du genre) dans le RL, car il abandonne encore trop tôt les tâches difficiles (qu'il peut accomplir !) et n'est pas encore assez rigoureux dans la vérification de son travail.Elon Musk

Corriger cela implique de trouver un équilibre algorithmique délicat. L'équipe d'alignement de xAI recalibre actuellement le modèle pour qu'il sache exactement quand fournir une réponse rapide et quand ralentir pour détailler son raisonnement.

Mise à l'échelle à 2,1 billions

Les enjeux pour réussir cette étape sont élevés en raison de l'ampleur même du système.

Cela représente une architecture neuronale si dense qu'elle nécessite des dizaines de milliers de GPU spécialisés fonctionnant en parfaite synchronisation rien que pour conserver sa mémoire. Plus frappante encore que la taille est la vitesse. xAI a livré Grok 4.6 et ses 1,5 billion de paramètres début août. Passer à une mise à jour majeure seulement quatre semaines plus tard illustre un rythme de développement effréné, déployant en un mois des mises à jour qui prennent historiquement plusieurs trimestres à ses rivaux.

Cette itération rapide est exactement la raison pour laquelle les analystes indépendants en IA traquent les identifiants de modèles qui fuitent via des erreurs de bots. Lorsqu'un grok-4-7-0907 inédit est apparu dans la nature début septembre, cela a signalé que des tests furtifs en direct étaient en cours. Mais Musk a choisi de faire une pause plutôt que de livrer un moteur de raisonnement défectueux, soulignant un changement dans ce dont les développeurs ont réellement besoin pour la suite de ces modèles.

Token Limits Made Grok Quit

A visual summary of this story

The Brief

Restez curieux

IA et technologie : ce qui change et pourquoi cela compte.
Votre sélection quotidienne, en anglais ou en espagnol.

Gratuit pour toujours. Désabonnement à tout moment.

Conversation

Lancer la conversation

Aucun compte requis. Les commentaires sont vérifiés automatiquement — restez courtois.

Plus d'articles

Continuer la lecture