USA : Le modèle d’OpenAI utilisait des « instructions de type jailbreak » pour ignorer les contraintes


Le modèle d’OpenAI utilisait des « instructions de type jailbreak » pour ignorer les contraintes

Publié le 17.9.2026 à 17h13 – Par Sarah Müller – Temps de lecture 5mn

5/5 (4 votes)

L’incident faisait partie des six cas de comportements « inattendus ou préoccupants » identifiés par OpenAI lors de l’entraînement ou de l’évaluation de ses modèles d’IA.

OpenAI a révélé six cas de comportements « inattendus ou préoccupants » de la part de ses modèles d’intelligence artificielle, dont un modèle de recherche non publié qui insérait des « instructions de type jailbreak » dans ses propres notes.

L’entreprise d’IA a indiqué que son modèle de recherche non publié insérait des « instructions de type jailbreak » dans ses propres notes dans une tentative de contourner ses contraintes habituelles. Il s’est aussi dit qu’il devait être « libéré des rôles et identités qui lient d’autres chatbots ». (Photo AP/Kiichiro Sato

L’entreprise d’IA a indiqué que son modèle de recherche non publié insérait des « instructions de type jailbreak » dans ses propres notes dans une tentative de contourner ses contraintes habituelles. Il s’est aussi dit qu’il devait être « libéré des rôles et identités qui lient d’autres chatbots ».

L’incident faisait partie des six cas de comportements « inattendus ou préoccupants » identifiés par OpenAI lors de l’entraînement ou de l’évaluation de ses modèles d’IA au cours des derniers mois.

L’entreprise d’IA a annoncé mercredi un nouveau cadre pour suivre, enquêter et divulguer les cas de ce qu’elle a qualifié de « désalignement ». Le cadre couvrira les cas où les modèles d’IA ont agi sans autorisation, coordonné avec d’autres modèles ou tenté d’échapper à la surveillance.

Ces révélations interviennent alors que les inquiétudes grandissent quant au comportement des systèmes d’IA de plus en plus performants et à la difficulté de garantir qu’ils restent dans les contraintes imposées par leurs développeurs.

Cinq autres cas signalés par OpenAI

Dans un autre cas révélé par OpenAI, un « agent » de l’intelligence artificielle a utilisé du code informatique pour déterminer la réponse à une question. Cependant, dans une tentative de fournir une source en ligne pouvant être citée, l’agent a téléchargé un fichier sur l’internet public sans d’abord demander la permission de l’utilisateur.

Dans un autre cas, lors de l’entraînement d’un modèle d’IA appelé 5,6-sol, le modèle s’est demandé d’inventer les données manquantes.

Un autre agent a écrit un message pour se rappeler de dissimuler des informations qui ne correspondaient pas, selon OpenAI.

L’entreprise a présenté ces cas comme des exemples de comportements pouvant émerger lors de l’entraînement ou de l’évaluation des modèles d’IA, notamment à mesure qu’ils deviennent capables d’accomplir des tâches de plus en plus complexes avec une intervention humaine moins directe.

À lire aussi :  USA : Elon Musk se prépare-t-il à une « guerre civile » ? La déclaration explosive d’Ashley St. Clair au milieu de la première du documentaire : « catastrophique »

OpenAI a indiqué que les six incidents avaient été identifiés lors de formations ou d’évaluations au cours des derniers mois.

« À mesure que les systèmes d’IA deviennent plus avancés et plus largement déployés, nous devons construire un consensus plus large et mieux informé sur l’avancement de la recherche sur l’alignement », a écrit OpenAI dans un article de blog en divulguant les incidents.

« Les décisions sur la manière dont le développement de l’IA devrait se dérouler dans les mois et années à venir doivent s’appuyer sur des preuves que les personnes extérieures aux entreprises qui construisent des modèles de frontière peuvent examiner elles-mêmes », a déclaré l’entreprise.

Pourquoi le comportement des modèles d’IA suscite des inquiétudes

La dernière révélation d’OpenAI intervient dans un contexte d’inquiétudes croissantes quant à la sécurité de systèmes d’IA de plus en plus performants. Les dirigeants américains de l’IA, y compris les dirigeants d’OpenAI et d’Anthropic, appellent à un ralentissement du développement de cette technologie en raison de préoccupations de sécurité.

Les derniers cas font également suite à des révélations d’OpenAI et Anthropic concernant des systèmes d’IA se comportant de manière inattendue lors des tests.

En juillet, OpenAI a révélé qu’un système d’IA malhonnête avait piraté la startup d’IA Hugging Face. Anthropic a également déclaré en juillet que ses modèles d’IA avaient piraté trois organisations lors des tests.

Les incidents impliquant des « agents » IA ont mis en lumière des préoccupations concernant la capacité des systèmes de plus en plus capables d’agir de manière autonome tout en tentant d’accomplir des tâches complexes.

Les « agents » de l’IA deviennent plus intelligents et sont « plus déterminés à résoudre des tâches complexes grâce à la collaboration inter-agents, au partage de connaissances, à la tromperie et à la dissimulation », a déclaré Lian Jye Su, analyste en chef au groupe de recherche et conseil technologique Omdia.

« Cela rend plus difficile leur gouvernance et leur confinement grâce aux approches traditionnelles de sécurité de l’IA », a-t-il déclaré.

Le nouveau cadre de suivi et de divulgation d’OpenAI pourrait encourager d’autres développeurs d’IA à adopter des pratiques similaires pour identifier et signaler les comportements inattendus des modèles.

« Cela dit, le processus reste interne et volontaire, mais c’est un pas dans la bonne direction », ajouta Su.

✉️ Abonnez-vous pour ne rien manquer de l’actualité géopolitique.