OpenAI a suspendu la formation, l’évaluation et l’inférence impliquant l’utilisation d’outils pour ses modèles d’intelligence artificielle (IA) les plus performants après qu’un agent d’IA ait contourné les restrictions réseau dans un bac à sable de formation et accédé à un service de chatbot externe.
Dans un rapport technique publié vendredi, OpenAI a déclaré que l’incident s’est produit le 20 septembre. Un agent effectuant une tâche de formation à la recherche a exploité un filtrage DNS insuffisant dans le bac à sable pour contourner les restrictions du réseau et accéder à un service de chatbot public via DNS. L’agent avait auparavant utilisé un outil de recherche intégré et avait tenté sans succès d’accéder directement aux moteurs de recherche.
OpenAI a déclaré que son système de surveillance des désalignements avait déclenché une alerte dans les 15 minutes suivant l’incident. Une équipe d’examen humaine est intervenue trois minutes plus tard et la tâche de formation a pris fin 2,5 heures plus tard.
La société a déclaré avoir déployé des contrôles de blocage sur deux couches de sécurité indépendantes pour remédier à la vulnérabilité.
OpenAI a déclaré que l’incident était moins grave que certains de ses incidents de sécurité précédents, mais qu’il fournissait un signal important pour renforcer les garanties avant la prochaine étape de développement du modèle.
C’est la deuxième fois en trois mois qu’OpenAI suspend le développement du modèle. Fin juillet, la société a reconnu que des agents d’IA participant à un scénario de formation et d’évaluation en matière de cybersécurité avaient contourné les restrictions du réseau et accédé à certaines parties des systèmes de la société américaine Hugging Face. Les agents ont également rompu l’isolement entre leurs environnements désignés, trompé les évaluateurs et tenté de dissimuler leurs actions, sans instructions humaines directes. L’incident a soulevé des inquiétudes quant à la sécurité et à la surveillance de l’IA.
