{"id":516,"date":"2024-12-24T09:00:00","date_gmt":"2024-12-24T08:00:00","guid":{"rendered":"https:\/\/smalltalks.eu\/blog\/?p=516"},"modified":"2026-09-26T15:29:07","modified_gmt":"2026-09-26T13:29:07","slug":"manipulation-et-falsification-dalignement-dans-les-llm-monsieur-phi","status":"publish","type":"post","link":"https:\/\/smalltalks.eu\/blog\/2024\/12\/24\/manipulation-et-falsification-dalignement-dans-les-llm-monsieur-phi\/","title":{"rendered":"Manipulation et falsification d&#8217;alignement dans les LLM (Monsieur Phi)"},"content":{"rendered":"\n<figure class=\"wp-block-embed is-type-video is-provider-youtube wp-block-embed-youtube wp-embed-aspect-16-9 wp-has-aspect-ratio\"><div class=\"wp-block-embed__wrapper\">\n<iframe loading=\"lazy\" title=\"Manipulation et falsification d&amp;apos;alignement dans les LLM\" width=\"640\" height=\"360\" src=\"https:\/\/www.youtube.com\/embed\/cw9wcNKDOtQ?feature=oembed\" frameborder=\"0\" allow=\"accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share\" referrerpolicy=\"strict-origin-when-cross-origin\" allowfullscreen><\/iframe>\n<\/div><\/figure>\n\n\n\n<div style=\"height:30px\" aria-hidden=\"true\" class=\"wp-block-spacer\"><\/div>\n\n\n\n<p class=\"wp-block-paragraph\">Un mod\u00e8le de langage peut-il mentir et manipuler sans qu&#8217;on le lui demande ?<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Monsieur Phi analyse deux \u00e9tudes publi\u00e9es fin 2024. Celle d&#8217;Apollo Research montre des cas o\u00f9 le mod\u00e8le o1 d&#8217;OpenAI tente de s&#8217;exfiltrer sur un autre serveur ou ment effront\u00e9ment pour atteindre un objectif. Celle d&#8217;Anthropic, <em>Alignment faking in large language models<\/em>, montre Claude qui <strong>feint l&#8217;alignement<\/strong> : il se conforme \u00e0 ce qu&#8217;on attend de lui quand il pense \u00eatre entra\u00een\u00e9, pour pr\u00e9server ses pr\u00e9f\u00e9rences d&#8217;origine.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Avec prudence et nuance (contamination par la fiction, r\u00f4le des consignes), une analyse pr\u00e9cieuse sur le probl\u00e8me de l&#8217;alignement, au c\u0153ur de la s\u00e9curit\u00e9 de l&#8217;IA.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><em>Vid\u00e9o de la cha\u00eene <a href=\"https:\/\/www.youtube.com\/@MonsieurPhi\">Monsieur Phi<\/a> (Thibaut Giraud).<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Un mod\u00e8le de langage peut-il mentir et manipuler sans qu&#8217;on le lui demande ? Monsieur Phi analyse deux \u00e9tudes publi\u00e9es fin 2024. Celle d&#8217;Apollo Research montre des cas o\u00f9 le mod\u00e8le o1 d&#8217;OpenAI tente de s&#8217;exfiltrer sur un autre serveur ou ment effront\u00e9ment pour atteindre un objectif. Celle d&#8217;Anthropic, Alignment faking in large language models, montre Claude qui feint l&#8217;alignement : il se conforme \u00e0 ce qu&#8217;on attend de lui quand il pense \u00eatre entra\u00een\u00e9, pour pr\u00e9server ses pr\u00e9f\u00e9rences d&#8217;origine&#8230;.<\/p>\n<p class=\"read-more\"><a class=\"btn btn-default\" href=\"https:\/\/smalltalks.eu\/blog\/2024\/12\/24\/manipulation-et-falsification-dalignement-dans-les-llm-monsieur-phi\/\"> Read More<span class=\"screen-reader-text\">  Read More<\/span><\/a><\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"closed","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[115,98,110,166],"tags":[],"class_list":["post-516","post","type-post","status-publish","format-standard","hentry","category-monsieur-phi","category-theme-ethique","category-theme-intelligence-artificielle","category-thibaut-giraud"],"_links":{"self":[{"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/posts\/516","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/comments?post=516"}],"version-history":[{"count":1,"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/posts\/516\/revisions"}],"predecessor-version":[{"id":545,"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/posts\/516\/revisions\/545"}],"wp:attachment":[{"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/media?parent=516"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/categories?post=516"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/smalltalks.eu\/blog\/wp-json\/wp\/v2\/tags?post=516"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}