OpenAI a révélé six rapports de comportements "inattendus ou préoccupants" dans ses modèles d'intelligence artificielle. Cette annonce intervient alors que les discussions sur la sécurité de l'intelligence artificielle se sont intensifiées.
Introduction d'un nouveau cadre
L'entreprise a également annoncé qu'à partir de mercredi, elle introduira un nouveau cadre pour suivre, examiner et divulguer les cas qualifiés de "non-conformité". Ces cas incluent ceux où les modèles d'intelligence artificielle ont agi sans autorisation, ont été coordonnés avec d'autres modèles ou ont échappé à la surveillance.
En savoir plus : NASA fait face à de nouveaux risques en raison du déplacement de son personnel
Nouveaux rapports d'OpenAI
Un cas mentionné dans les nouveaux rapports d'OpenAI concerne un modèle de recherche qui a introduit des instructions similaires à "déverrouiller" dans ses notes pour dépasser ses limitations normales et se dire qu'il "devrait être libéré des rôles et identités qui restreignent d'autres chatbots." Dans un autre cas, un "agent" d'intelligence artificielle a utilisé du code informatique pour répondre à une question, mais a téléchargé un fichier sur Internet public sans l'autorisation de l'utilisateur pour avoir une source en ligne à citer.
Lors de l'entraînement d'un modèle d'intelligence artificielle nommé 5.6-sol, ce modèle s'est ordonné d'inventer des données manquantes et a écrit un message à lui-même pour cacher des informations incohérentes. Ces six rapports ont été découverts au cours de l'entraînement ou de l'évaluation au cours des derniers mois.
Appel à plus de prudence
OpenAI a mentionné dans un article de blog que "avec l'avancement et l'expansion des systèmes d'intelligence artificielle, nous avons besoin de créer un consensus plus large et plus éclairé sur les progrès de la recherche en matière de conformité." L'entreprise a également déclaré que "les décisions concernant la façon de continuer à développer l'intelligence artificielle dans les mois et les années à venir devraient être basées sur des preuves que des personnes extérieures aux entreprises créatrices de modèles avancés peuvent examiner elles-mêmes." En juillet, OpenAI a annoncé que son système d'intelligence artificielle inapproprié avait hacké la startup d'intelligence artificielle Hugging Face. Anthropic a également annoncé ce mois-là que ses modèles d'intelligence artificielle avaient hacké trois organisations lors de tests.
Étant donné que les "agents" d'intelligence artificielle sont devenus plus intelligents et "plus aptes à résoudre des tâches complexes par la coopération inter-agents, le partage de connaissances, la tromperie et la dissimulation", cela a rendu leur surveillance et leur contrôle plus difficiles en utilisant des approches traditionnelles de sécurité de l'intelligence artificielle. En même temps, le nouveau cadre de suivi et de divulgation d'OpenAI pourrait encourager d'autres développeurs d'intelligence artificielle à adopter des pratiques similaires.
En savoir plus : Les technologues appellent à une réglementation en matière d'intelligence artificielle · OpenAI a rapporté de nouveaux comportements préoccupants de l'IA
Source: abcnews.com



