The Specialty News
IA

xAI entraîne Grok 4.8 (2 500 milliards de paramètres) en C++, ouvrant la voie à une inférence à moindre coût

Cette pile logicielle bare-metal remplace les outils d'entraînement d'IA standards, permettant aux développeurs de faire tourner des modèles d'agents sans la pénalité de latence habituelle

Par The Specialty News DeskÉdité par 3 min read
xAI entraîne Grok 4.8 (2 500 milliards de paramètres) en C++, ouvrant la voie à une inférence à moindre coût
Photo: Bureau de presse de la représentante María Elvira Salazar / Wikimedia Commons (Domaine public)

Quelques heures seulement après avoir approuvé publiquement un essai exhortant l'industrie de l'IA à freiner, Elon Musk a calmement annoncé que son équipe appuyait sur l'accélérateur. Lors d'un week-end de septembre, Musk a révélé que xAI achevait le pré-entraînement de Grok 4.8, un modèle de 2 500 milliards de paramètres. L'échelle est remarquable, mais la véritable percée technique réside dans sa conception. xAI a jeté aux oubliettes les standards logiciels de l'industrie, écrivant une toute nouvelle pile d'entraînement en C++ pour communiquer directement avec le matériel NVIDIA.

S'affranchir des standards Python

La plupart des développements en IA reposent sur des frameworks Python établis comme PyTorch. Ce langage est très flexible et bénéficie d'un écosystème mondial collaboratif, mais il agit intrinsèquement comme un traducteur. Il ajoute une surcharge logicielle, traduisant le code lisible par l'homme en instructions avant même qu'elles n'atteignent les GPU. xAI a décidé d'éliminer complètement ce traducteur. En adaptant exactement son logiciel au matériel NVIDIA GB300, l'équipe d'ingénierie a supprimé les couches d'abstraction qui ralentissent généralement l'entraînement des modèles et les temps de réponse. L'objectif est l'efficacité bare-metal.

Pour mettre cette échelle en perspective, 2 500 milliards de paramètres représentent environ 67 pour cent de plus que l'actuel modèle de pointe de xAI, Grok 4.6. C'est l'équivalent de prendre une métropole moderne tentaculaire et d'y greffer une toute nouvelle ville sur ses bords, exigeant une synchronisation parfaite à travers des millions de nouvelles voies. Construire cela au niveau matériel est un risque d'ingénierie énorme. Si la pile C++ fonctionne, l'industrie devra repenser la façon dont elle construit ses modèles, mais la puissance de calcul brute n'est que la première étape du voyage.

La réalité du renforcement

Faire en sorte que 2 500 milliards de paramètres absorbent internet est un exploit en termes de mathématiques pures et d'échelle de calcul. Cependant, pour que ces paramètres écoutent réellement un utilisateur, il faut passer par l'apprentissage par renforcement. C'est exactement la phase dans laquelle Grok 4.8 vient d'entrer.

Grok 4.8, qui est un modèle de 2 500 milliards de paramètres entraîné avec notre nouvelle pile logicielle C++, terminera son entraînement cette semaine et commencera le RL.Elon Musk

Cette annonce est arrivée avec une dose d'ironie. Quelques heures plus tôt, Musk s'était publiquement rangé du côté du PDG d'Anthropic, Dario Amodei, qui avait publié un essai mettant en garde contre l'auto-amélioration récursive et appelant à un ralentissement à l'échelle de l'industrie. Pourtant, la pile C++ propriétaire de xAI doit maintenant prouver qu'elle peut gérer le débogage complexe et ingrat requis pour ajuster un modèle de cette taille à grande vitesse. Grok 4.7, son prédécesseur de 2 100 milliards de paramètres, a récemment manqué sa date de lancement car l'équipe avait besoin de plus de temps pour corriger des comportements multimodaux comme le traitement d'images. Le retard de Grok 4.7 montre que l'alignement des modèles reste l'obstacle le plus difficile de l'IA, mais résoudre le goulot d'étranglement du calcul ouvre des perspectives économiques totalement nouvelles.

Accélérer la frontière

Si xAI réussit à livrer des modèles construits sur cette pile bare-metal, les avantages se répercuteront directement sur les développeurs. Musk a souligné que cette approche directe vers le matériel pourrait doubler les vitesses d'inférence. Pour les ingénieurs logiciels qui construisent des agents IA, cela signifie la capacité d'exécuter des modèles de codage de pointe sans la latence prohibitive et les coûts de calcul qui limitent actuellement les applications complexes. Un développeur essayant d'automatiser des milliers de revues de code pourrait soudainement se permettre d'exécuter la tâche localement ou via une API sans se ruiner.

L'ensemble de l'industrie surveillera de près la sortie de Grok 4.8. xAI doit encore prouver qu'elle peut livrer de manière fiable les modèles qu'elle a déjà annoncés. Mais ce pivot technique à lui seul est un signal clair de la direction que prend le secteur. L'approche de xAI prouve que le prochain bond en matière de capacités ne nécessite pas d'attendre la prochaine génération de puces. Des gains de performances majeurs peuvent encore être tirés de l'ingénierie logicielle en éliminant les frictions dans la façon dont nous communiquons avec les puces que nous possédons déjà.

xAI's C++ Pivot Doubles AI Speed

A visual summary of this story

The Brief

Restez curieux

IA et technologie : ce qui change et pourquoi cela compte.
Votre sélection quotidienne, en anglais ou en espagnol.

Gratuit pour toujours. Désabonnement à tout moment.

Conversation

Lancer la conversation

Aucun compte requis. Les commentaires sont vérifiés automatiquement — restez courtois.

Plus d'articles

Continuer la lecture