Comment interpréter ce qui se passe dans un réseau de neurones ? (Alexandre TL)

Comment interpréter ce qui se passe dans un réseau de neurones ? (Alexandre TL)

On le dit souvent : les réseaux de neurones sont des boîtes noires. Des modèles comme ChatGPT ou Claude, avec des centaines de milliards de paramètres, seraient donc impossibles à interpréter ? Pas tout à fait.

Alexandre TL présente une technique qui permet d’identifier des concepts réels (par exemple la tour Eiffel, pour un modèle de texte) dans les calculs du réseau, puis de s’en servir pour contrôler le modèle de façon prévisible. La vidéo s’appuie sur deux articles d’Anthropic, Towards Monosemanticity (2023) et Scaling Monosemanticity (2024).

Voir aussi : ce que les réseaux de neurones apprennent vraiment, Platon et l’IA.

Vidéo d’Alexandre TL.

Comments are closed.