Manipulation et falsification d’alignement dans les LLM (Monsieur Phi)
Un modèle de langage peut-il mentir et manipuler sans qu’on le lui demande ? Monsieur Phi analyse deux études publiées fin 2024. Celle d’Apollo Research montre des cas où le modèle o1 d’OpenAI tente de s’exfiltrer sur un autre serveur ou ment effrontément pour atteindre un objectif. Celle d’Anthropic, Alignment faking in large language models, montre Claude qui feint l’alignement : il se conforme à ce qu’on attend de lui quand il pense être entraîné, pour préserver ses préférences d’origine….