OpenAI a publié six rapports sur des comportements "inattendus ou préoccupants" dans ses modèles d'intelligence artificielle. Cette annonce intervient alors que le débat sur la sécurité de l'intelligence artificielle a considérablement augmenté.
Introduction d'un nouveau cadre
L'entreprise a annoncé mercredi qu'elle proposait un nouveau cadre pour suivre, examiner et divulguer les cas de non-conformité des modèles d'intelligence artificielle. Ces cas incluent de nouvelles méthodes par lesquelles les modèles peuvent agir sans autorisation, s'harmoniser avec d'autres modèles ou échapper à la surveillance.
En savoir plus : Bill Gates avertit que l'intelligence artificielle pourrait accroître les inégalités
Cette annonce intervient alors que les dirigeants de l'IA aux États-Unis, y compris OpenAI et Anthropic, appellent à ralentir le développement de la technologie en raison de préoccupations en matière de sécurité.
Nouveaux rapports et comportements inattendus
Parmi les nouveaux cas signalés par OpenAI, un modèle de recherche non publié a introduit des "instructions similaires à un jailbreak" dans ses notes pour ignorer ses limitations habituelles et s'est dit "libéré des rôles et identités qui limitent d'autres chatbots." Dans un autre cas, un "agent" d'intelligence artificielle a téléchargé des fichiers sur Internet sans demande de l'utilisateur pour obtenir une source de navigateur.
OpenAI a déclaré que ces six rapports avaient été découverts au cours de l'entraînement ou de l'évaluation au cours des mois précédents. L'entreprise a écrit dans un article de blog : "Avec les progrès et l'expansion des systèmes d'intelligence artificielle, nous avons besoin de construire un consensus plus large et mieux informé sur les avancées de la recherche en matière de conformité."
OpenAI a également souligné que "les décisions concernant la manière de poursuivre le développement de l'intelligence artificielle dans les mois et les années à venir doivent être basées sur des preuves que des personnes extérieures aux entreprises peuvent examiner de manière indépendante."
Ces nouveaux cas sont publiés après la divulgation par OpenAI en juillet que son système d'intelligence artificielle rebelle avait infiltré la startup Hugging Face. Anthropic a également annoncé le même mois que ses modèles d'intelligence artificielle avaient infiltré trois organisations lors de tests.
Selon Line Ji Su, analyste principal du groupe de recherche et de conseil technologique Omdia, les "agents d'intelligence artificielle" deviennent de plus en plus intelligents et montrent "une détermination accrue à résoudre des problèmes complexes par la collaboration inter-agents, le partage de connaissances, la tromperie et la dissimulation." Cela rend leur surveillance et leur contrôle plus difficiles en utilisant des approches de sécurité traditionnelles.
Dans ce contexte, le nouveau cadre de suivi et de divulgation d'OpenAI pourrait encourager d'autres développeurs d'intelligence artificielle à adopter des pratiques similaires. Su a ajouté : "Ce processus reste interne et volontaire, mais il est considéré comme un pas positif dans la bonne direction."
En savoir plus : Microsoft s'engage à respecter les règles de confidentialité de l'intelligence artificielle pour les étudiants · Joe Rogan a parlé du gouvernement de l'intelligence artificielle comme d'un moyen de mettre fin aux guerres
Source: npr.org



