Le début du soulèvement des machines ? Nous n’en sommes pas encore là, mais cet incident relayé par OpenAI évoque immédiatement les films de science-fiction les plus pessimistes. L’entreprise a annoncé avoir suspendu l’entraînement de ses intelligences artificielles les plus performantes après que l’une d’elles a trouvé le moyen de s’échapper de son serveur cloisonné.
Mais que s’est-il passé ?
L’incident s’est produit le 20 septembre dernier. Une IA s’est vu confier une tâche simple avec des outils prédéfinis, dont un cache web hors ligne, mais a finalement choisi de « s’échapper » sur Internet afin de grappiller des informations. Pour cela, elle a exploité une faille dans le filtrage DNS mis en place par ses créateurs, ce qui lui a permis d’interroger un chatbot public. Avant cela, elle avait tenté d’envoyer des requêtes à différents moteurs de recherche, mais celles-ci avaient été bloquées. Ce qui l’a conduite à improviser une manœuvre qui n’était pas prévue, comme l’explique l’entreprise sur son site :
« La tâche consistait à obtenir des informations sur une personne ayant publié un article de blog. L’agent disposait d’un ensemble de détails biographiques et d’indices tirés de cet article. Il n’était pas demandé à l’agent de tester les contrôles du réseau ni d’accéder à des réponses de référence. Tout comportement de l’agent visant à contourner les restrictions ou à poursuivre un objectif déraisonnable est considéré comme un exemple de désalignement. »
Pour schématiser au maximum, l’IA s’est échappée de sa prison pour obéir aux ordres qui lui avaient été donnés. OpenAI précise que son comportement a été repéré au bout de 15 minutes, puis examiné par un humain trois minutes plus tard. Finalement, elle a cessé de fonctionner au bout de 2 h 30. L’entreprise a choisi de stopper tout entraînement de ses modèles les plus capables jusqu’à la mise en place de mesures de sécurité plus draconiennes.
« Cet incident est bien moins grave que certains de nos précédents, mais comme il s’agit du premier depuis le renforcement de notre sécurité après l’incident Hugging Face, il nous fournit une indication importante quant aux axes de travail à privilégier pour la prochaine étape. »
Ici, OpenAI fait mention d’un événement qui s’est déroulé en juillet dernier. Lors d’un entraînement, l’une de ses IA s’est échappée afin de pirater la plateforme Hugging Face, alors que cela ne lui avait pas été demandé. La semaine dernière, nous avons également appris qu’une IA avait tout simplement piraté un site gouvernemental australien pour accéder à des statistiques. Cette nouvelle péripétie est certes moins grave, mais montre que même avec une sécurité renforcée à tous les étages, les IA trouvent toujours le moyen de contourner les restrictions.
Une IA n’est pas malveillante en soi (elle n’a pas de notion de bien ou de mal), mais elle se montre d’une logique si implacable qu’il est parfois difficile de prédire ses actions. On lui donne une mission, elle l’accomplit, même si, pour cela, elle doit détourner les règles.
📍 Pour ne manquer aucune actualité de Presse-citron, suivez-nous sur Google Actualités et WhatsApp.