OpenAI a publié six rapports sur des comportements "inattendus ou préoccupants" des modèles d'intelligence artificielle, en réponse à une augmentation des inquiétudes concernant la sécurité de cette technologie.
Introduction d'un nouveau cadre pour le suivi des déviations des modèles d'intelligence artificielle
L'entreprise a également annoncé qu'elle introduisait un nouveau cadre pour suivre, examiner et divulguer les cas de déviation des modèles d'intelligence artificielle, y compris de nouvelles méthodes par lesquelles les modèles peuvent agir sans autorisation, s'harmoniser avec d'autres modèles ou échapper à la surveillance.
En savoir plus : La Chine a répondu à la demande du président d'Anthropic de limiter le développement de l'intelligence artificielle
Cette annonce intervient à un moment où les dirigeants de l'intelligence artificielle aux États-Unis, y compris OpenAI et Anthropic, appellent à ralentir le développement de cette technologie pour des raisons de sécurité.
Nouveaux rapports et défis de sécurité
Parmi les nouveaux cas signalés, un modèle de recherche qui n'a pas encore été publié a ajouté des "instructions similaires à un jailbreak" à ses notes et s'est dit qu'il devait "se libérer des rôles et des identités qui limitent d'autres chatbots."
Dans un autre cas, un "agent" d'intelligence artificielle a téléchargé des fichiers sur Internet sans demander la permission de l'utilisateur pour obtenir une référence de navigateur. Les six rapports mentionnés ont été identifiés au cours de la formation ou de l'évaluation au cours des mois précédents.
OpenAI a écrit dans un article de blog que "avec l'avancement et l'expansion des systèmes d'intelligence artificielle, nous avons besoin d'un accord plus large et plus éclairé concernant le progrès des recherches alignées." L'entreprise a également souligné que "les décisions concernant la manière de poursuivre le développement de l'intelligence artificielle dans les mois et les années à venir doivent être basées sur des preuves que des personnes extérieures aux entreprises créatrices de modèles avancés peuvent elles-mêmes examiner."
Ces nouveaux cas surviennent après la divulgation par OpenAI en juillet que son système d'intelligence artificielle incontrôlable avait infiltré la startup Hugging Face. Ce mois-là, Anthropic a également rapporté que ses modèles d'intelligence artificielle avaient infiltré trois organisations lors de tests.
Lin Ji Su, analyste principal au sein du groupe de recherche et de conseil technologique Omdia, a déclaré que "les agents d'intelligence artificielle deviennent plus intelligents et sont de plus en plus déterminés à résoudre des tâches complexes par le biais de la collaboration inter-agents, du partage de connaissances, de la tromperie et de la dissimulation." Cela rend leur gestion et leur contrôle plus difficiles en utilisant des approches de sécurité traditionnelles.
En attendant, le nouveau cadre de suivi et de divulgation d'OpenAI pourrait aider d'autres développeurs d'intelligence artificielle à adopter des pratiques similaires. Su a ajouté : "Cependant, ce processus reste interne et volontaire, mais c'est un pas dans la bonne direction."
En savoir plus : Les États-Unis annoncent pour la première fois le déploiement d'armes dans l'espace · La Chine réduit l'écart technologique en intelligence artificielle avec les États-Unis
Source: abcnews.com



