Moonshot AI réinvente le Transformer avec les Attention Residuals
En remplaçant les connexions statiques par une attention dynamique dépendante des entrées, Moonshot revendique un gain d'efficacité de calcul de 1.25x.

Depuis des années, la « connexion résiduelle » est l'épine dorsale silencieuse de tous les grands LLM, agissant comme une autoroute fixe qui transporte les données à travers un réseau. Mais Moonshot AI vient de signaler que cette autoroute commence à s'engorger. En introduisant les « Attention Residuals », l'entreprise passe d'une sommation statique à un système de récupération dynamique et sélectif qui promet de rendre les modèles à la fois plus efficaces et plus intelligents pour traiter des raisonnements complexes à long contexte.
Briser le goulot d'étranglement de la sommation
Dans les architectures Transformer traditionnelles, connexions résiduelles ajoutent la sortie de chaque couche à la suivante en utilisant des poids fixes. À mesure que les modèles gagnent en profondeur, les chercheurs constatent un problème persistant: la dilution de l'information. Parce que le réseau impose une accumulation uniforme des états cachés, les signaux des premières couches se retrouvent souvent noyés dans le bruit de la pile plus profonde. Cela entraîne une instabilité et oblige les couches individuelles à générer des états cachés plus grands et plus lourds simplement pour rester pertinentes.
L'AttnRes de Moonshot remplace cette arithmétique rigide par un mécanisme d'attention appris et dépendant des entrées. Au lieu d'ajouter simplement des informations, chaque couche utilise un vecteur de « pseudo-requête » pour choisir les représentations précédentes dont elle a réellement besoin. En divisant ces couches en unités « Block AttnRes », l'équipe a transformé un problème de mémoire complexe en une opération $O(Nd)$ gérable. Le résultat est une architecture qui se comporte moins comme un pipeline statique et plus comme un filtre intelligent, récupérant exactement les informations nécessaires à la tâche en cours.
L'avenir des réseaux plus profonds et plus légers

L'apport le plus convaincant de cette avancée réside dans son efficacité pure. La validation de Moonshot sur son architecture Kimi Linear de 48B montre un avantage de calcul de 1.25x, ce qui signifie qu'un modèle utilisant AttnRes peut être aussi performant qu'un modèle de référence nécessitant 25% de puissance d'entraînement en plus. Mieux encore, ce gain de performance s'accompagne d'une surcharge de latence négligeable de moins de 2%, ce qui en fait une solution de remplacement pratique et directe pour les systèmes à grande échelle existants.
“Tout comme nous sommes passés des RNN aux Transformers pour débloquer une meilleure attention au fil du temps, nous entrons peut-être dans une ère où nous appliquons cette même attention sélective à la profondeur de nos modèles.”
Il ne s'agit pas d'une simple accélération marginale; cela représente un changement fondamental dans notre façon de concevoir la profondeur des réseaux. Tout comme nous sommes passés des RNN aux Transformers pour débloquer une meilleure attention au fil du temps, nous entrons peut-être dans une ère où nous appliquons cette même attention sélective à la profondeur de nos modèles. Si l'AttnRes résiste à un examen plus large de l'industrie, elle fournira un modèle pour construire des réseaux de neurones plus profonds et plus stables qui ne se transforment pas en pièges d'efficacité, ouvrant ainsi une voie claire pour des modèles d'IA plus performants et axés sur la logique.
Rewiring the Transformer
The Brief
Restez curieux
IA et technologie : ce qui change et pourquoi cela compte.
Votre sélection quotidienne, en anglais ou en espagnol.
Gratuit pour toujours. Désabonnement à tout moment.
Plus d'articles

The Specialty News





Conversation
Lancer la conversation