Moonshot AI réinvente la profondeur des réseaux de neurones avec les Résidus d'Attention
Un nouvel ajustement architectural apporte un gain d'efficacité de calcul de 1,25x en repensant la façon dont les couches partagent l'information.

Depuis plus d'une décennie, le deep learning s'appuie sur les « connexions résiduelles », une méthode simple et brutale pour empiler des couches dans un réseau de neurones. Aujourd'hui, l'équipe Kimi de Moonshot AI remet ce statu quo en question avec une nouvelle technique baptisée Résidus d'Attention. En remplaçant des connexions statiques et uniformes par un mécanisme dynamique et sélectif, elle démontre que la façon dont un modèle pense sa propre profondeur compte autant que la façon dont il traite les données d'entrée.
Résoudre le problème de la dilution de l'information
Dans les réseaux de neurones traditionnels, les connexions résiduelles fonctionnent comme une chaîne de seaux, transmettant l'information de couche en couche en ajoutant la sortie d'une couche à l'entrée de la suivante. Le défaut de cette approche d'« accumulation fixe » est que, lorsque l'information atteint la 50e ou la 100e couche, le signal des premières étapes est souvent dilué, enseveli sous une montagne de sommes cumulées. De plus, cette méthode traite chaque couche comme si elle avait la même importance, sans distinguer le bruit des représentations internes à forte valeur.
La solution de Moonshot AI, les Résidus d'Attention, applique la logique d'« attention » — la même technologie qui a fait des Transformers la force dominante de l'IA — à la pile verticale d'un modèle. Au lieu d'une addition rigide, chaque couche « prête attention » aux sorties précédentes, choisissant quelles informations passées sont pertinentes pour la tâche en cours. Pour gérer la charge de calcul massive que cela pourrait créer, l'équipe a introduit « Block AttnRes », qui répartit les couches en blocs compressés, garantissant que le système reste viable à grande échelle.
Les gains d'efficacité de la profondeur sélective

Les résultats de ce virage architectural sont frappants, en particulier pour les laboratoires aux budgets de calcul serrés. Validée sur l'architecture « Kimi Linear », cette méthode apporte un gain d'efficacité de 1,25x, ce qui signifie qu'un modèle peut atteindre la même qualité que son prédécesseur tout en consommant 25% de calcul d'entraînement en moins. Fait le plus marquant, cette amélioration s'accompagne d'une pénalité de moins de 2% sur la vitesse d'inférence, ce qui en fait un remplacement direct attractif pour les modèles existants.
“Nous entrons dans une ère où l'ingéniosité architecturale deviendra le principal levier de progrès, plutôt que le simple ajout de GPU H100 supplémentaires au problème.”
Si cette technique se généralise au-delà de l'architecture Kimi, les implications pour l'ensemble du secteur sont considérables. Nous entrons dans une ère où l'ingéniosité architecturale deviendra le principal levier de progrès, plutôt que le simple ajout de GPU H100 supplémentaires au problème. En traitant la « profondeur » d'un réseau comme une séquence à laquelle on peut accéder de façon sélective, les chercheurs ont ouvert une nouvelle dimension d'efficacité qui pourrait rendre la prochaine vague de modèles de pointe non seulement plus intelligente, mais nettement moins coûteuse à construire.
Depth, But Selective
The Brief
Restez curieux
IA et technologie : ce qui change et pourquoi cela compte.
Votre sélection quotidienne, en anglais ou en espagnol.
Gratuit pour toujours. Désabonnement à tout moment.
Plus d'articles

The Specialty News





Conversation
Lancer la conversation