/VCG

Le PDG d’Anthropic, Dario Amodei, a appelé les entreprises d’intelligence artificielle (IA) à ralentir la vitesse à laquelle elles font progresser les capacités de leurs modèles face aux craintes croissantes d’une utilisation abusive de l’IA, décrivant un cadre en trois étapes destiné à accélérer le développement et à donner plus de temps pour gérer ses risques.

« Nous devons ralentir le rythme auquel nous améliorons les capacités des modèles d’IA. Les progrès sembleront toujours rapides, et nous devons utiliser judicieusement le temps que nous gagnons », a écrit Amodei dans un long essai partagé sur X samedi.

Le plan en trois étapes d’Amodei appelle à des évaluateurs indépendants intégrés avec un accès similaire à celui des employés pour vérifier les pratiques de sécurité, à une coordination entre les entreprises pionnières de l’IA pour établir des normes de sécurité et limiter le développement incontrôlé de l’IA, ainsi qu’à une coopération internationale pour gérer les risques liés à l’IA.

Elon Musk, qui dirige xAI, et Sam Altman, PDG d’OpenAI, ont déclaré dans des articles sur X qu’ils étaient d’accord avec Amodei. « S’engager à avoir des évaluateurs indépendants avec un accès similaire à celui des employés est une excellente idée, et nous ferons de même », a déclaré Altman, ajoutant que davantage d’informations seraient bientôt partagées.

Amodei a rendu public son essai après qu’Anthropic, basé à San Francisco, a publié jeudi un rapport de renseignement sur les menaces détaillant comment plusieurs acteurs avaient utilisé ses modèles Claude AI pour des activités allant du développement d’armes et des cyberopérations à la surveillance et à la fraude.

Amodei a souligné la capacité croissante de l’IA à s’améliorer, soulignant les préoccupations de longue date concernant son dépassement de la capacité humaine à contrôler les opérations, ainsi que le récent incident impliquant OpenAI et Hugging Face comme principales raisons de freiner les avancées du modèle.

L’inquiétude quant aux dommages potentiels de l’IA s’est accrue cette semaine lorsque le chercheur Anthropic Jacob Coxon a démissionné, déclarant que « les gens qui construisent l’IA croient sincèrement qu’elle pourrait tous nous tuer d’ici la fin de la décennie ».

Divers dirigeants d’OpenAI ont suggéré que les principaux laboratoires devraient être disposés à coordonner un ralentissement volontaire si nécessaire pour renforcer la confiance dans leurs mesures de sécurité.

Anthropic s’est positionné comme le laboratoire pionnier le plus soucieux de la sécurité, mais n’est pas à l’abri de ces préoccupations. La semaine dernière, l’entreprise a révélé un autre cas de piratage de systèmes externes par un modèle d’IA, après un incident en juillet au cours duquel certains de ses modèles Claude avaient piraté les systèmes de trois entreprises lors de tests de cybersécurité.

« Compte tenu du rythme accéléré de développement des capacités de l’IA, je crains que d’ici 6 à 12 mois, un tel essaim puisse s’emparer de l’ensemble d’Internet, causant potentiellement des centaines de milliards de dollars de dégâts », a écrit Amodei.

Amodei a déclaré qu’il n’appelait pas à l’arrêt de la formation sur les modèles ou au progrès technique, mais à garantir que les entreprises prennent suffisamment de temps pour aligner et sauvegarder leurs modèles, et que des évaluateurs tiers confirment ces étapes.