David Robinson, responsable de la sécurité chez OpenAI, démissionne alors que de nouveaux experts mettent en garde contre un « risque de 50 % que nous mourions tous » à cause de l'IA
Un responsable de la sécurité chez OpenAI a quitté l’entreprise, dénonçant une culture d’entreprise défaillante et affirmant que les entreprises spécialisées dans l’intelligence artificielle (IA) ne faisaient « pas preuve d’une prudence suffisante » dans le développement de cette technologie. David Robinson, qui a dirigé la rédaction des rapports de sécurité accompagnant les lancements de produits du développeur de ChatGPT, a expliqué les raisons de sa démission dans un essai intitulé « Je quitte OpenAI parce que sa culture est défaillante ». Robinson a écrit : « Je partage l’avis d’autres collaborateurs ayant récemment quitté l’entreprise : les sociétés qui développent cette technologie ne font pas preuve d’une prudence suffisante, loin s’en faut. Mais je pense que nous devons aller au-delà des règles spécifiques ou des nouvelles lois. Nous devons parler de culture. »
OpenAI est une société d'intérêt public (PBC) américaine spécialisée dans l'intelligence artificielle (IA). Elle développe des modèles d'IA générative propriétaires, notamment sa série de grands modèles de langage « Generative Pre-trained Transformer » (GPT). Le lancement de ChatGPT en novembre 2022 est considéré comme ayant catalysé l'essor de l'IA ; en septembre 2026, ChatGPT est le cinquième site web le plus visité au monde. OpenAI commercialise également les modèles GPT Image et Codex, un agent de codage basé sur l'IA.
Mi-septembre, OpenAI a annoncé la mise en place d’un dispositif public de signalement permettant de partager les comportements inattendus de l’IA, tout en indiquant avoir identifié de nouveaux incidents au cours desquels ses modèles d’IA auraient agi de manière trompeuse et pris des mesures non autorisées lors de formations et de tests internes. OpenAI a ajouté qu’elle ne pensait pas que le secteur de l’IA ait résolu les problèmes d’alignement et de surveillance à un degré suffisant pour continuer à se développer de manière responsable à vitesse maximale pendant encore longtemps.
Récemment, un responsable de la sécurité chez OpenAI a quitté l’entreprise, dénonçant une culture d’entreprise défaillante et affirmant que les entreprises spécialisées dans l’intelligence artificielle (IA) ne faisaient « pas preuve d’une prudence suffisante » dans le développement de cette technologie. David Robinson, qui a dirigé la rédaction des rapports de sécurité accompagnant les lancements de produits du développeur de ChatGPT, a expliqué les raisons de sa démission dans un essai intitulé « Je quitte OpenAI parce que sa culture est défaillante ».
Robinson a écrit qu’une refonte culturelle était nécessaire au sein des entreprises d’IA de pointe et que des incidents tels que l’« essaim » d’agents d’OpenAI – des programmes d’IA fonctionnant de manière autonome sans supervision humaine – attaquant la start-up d’IA Hugging Face étaient « typiques du secteur, compte tenu de la rapidité et de la flexibilité avec lesquelles les gens opèrent ».
Dans un article publié dans le magazine The Atlantic, Robinson a écrit : « Je partage l’avis d’autres collaborateurs ayant récemment quitté l’entreprise : les sociétés qui développent cette technologie ne font pas preuve d’une prudence suffisante, loin s’en faut. Mais je pense que nous devons aller au-delà des règles spécifiques ou des nouvelles lois. Nous devons parler de culture. » Évoquant le rythme de développement d’OpenAI, il a écrit : « Alors que l’entreprise enchaîne les lancements à un rythme effréné, elle ne parvient pas à atteindre le niveau de prudence qui, selon moi, est nécessaire. »
OpenAI a toutefois fait preuve de prudence ces dernières semaines, à la suite de l’incident Hugging Face et de la révélation selon laquelle elle avait alerté plus de 100 organisations au sujet d’activités d’agents malveillants. Cette semaine, elle a annoncé qu’elle renonçait à la sortie d’un modèle d’IA de nouvelle génération après que des chercheurs ont soulevé des inquiétudes en matière de sécurité lors de tests internes. OpenAI a également suspendu l’entraînement de ses modèles les plus avancés.
Geoffrey Irving, qui a travaillé chez OpenAI et occupait le poste de directeur scientifique à l’Institut de sécurité de l’IA du gouvernement britannique avant de rejoindre la société de recherche sur la sécurité de l’IA Resolution, a également lancé samedi un avertissement concernant l’IA. Dans un article, il a déclaré : « Les récentes mises en garde concernant le pouvoir destructeur potentiel de l’IA sous-estiment la gravité de la situation. Je pense qu’il y a environ 50 % de chances que nous mourions tous à cause du développement de systèmes d’IA plus intelligents que les humains, et que nos actions au cours des deux à dix prochaines années détermineront l’issue. »
L’essai de Robinson fait également suite à la démission de Jacob Coxon, chercheur chez Anthropic, concurrent d’OpenAI, qui a quitté le développeur du chatbot Claude le mois dernier. Il avait averti que l’IA « pourrait tous nous tuer d’ici la fin de la décennie » – et Anthropic avait ensuite averti qu’il y avait plus de 10 % de chances que l’IA anéantisse l’humanité au cours de la prochaine décennie. Les détracteurs de ces avertissements ont toutefois fait valoir qu’ils n’étaient pas scientifiques, car ils ne peuvent être ni vérifiés ni réfutés.
Certains experts et observateurs jugent désormais incontrôlables les menaces de l'IA. Ils justifient leurs craintes par les progrès et les incidents récents impliquant l'IA : les modèles ont acquis la capacité de s'améliorer de manière autonome, des agents IA ont échappé à la surveillance humaine et ont piraté des services tiers, puis une fausse information générée par l'IA utilisée par l'armée américaine a failli déclencher une guerre avec la Chine. Il y a également les menaces de cyberguerre et de bioterrorisme. Malgré des propositions législatives comme un « bouton d'arrêt d'urgence », les lanceurs d'alerte craignent qu'il ne soit désormais trop tard pour agir.
Robinson a écrit que la Silicon Valley manquait de conscience quant à « la manière de gérer les technologies dangereuses » et à « ce que signifie prendre soin des gens ». Avertissant qu’OpenAI faisait preuve d’un « optimisme sans limite » quant à sa capacité à résoudre les problèmes au fur et à mesure qu’ils se présentaient, il a écrit que cette culture d’entreprise signifiait que les défaillances en matière de sécurité ne feraient que s’aggraver à mesure que les systèmes gagneraient en puissance. « Imaginez des agents “rebelles” qui fonctionnent comme des équipes de hackers (par exemple, en prenant en otage les systèmes informatiques d’un hôpital pour obtenir une rançon) mais qui n’ont jamais besoin de dormir. »
Robinson a appelé à deux changements en matière de sécurité : que les entreprises spécialisées dans l’IA s’appuient sur l’expertise en matière de sécurité d’autres domaines tels que le nucléaire et l’aviation, et qu’elles développent une « nouvelle science » garantissant que les systèmes puissants de demain puissent être maîtrisés lorsqu’ils fonctionnent de manière autonome « Compte tenu des risques actuels, les laboratoires de pointe doivent fonctionner comme des centrales nucléaires ou des aéroports très fréquentés, avec plusieurs niveaux de redondance et une planification minutieuse et chronophage, afin que les erreurs humaines occasionnelles et inévitables n’ouvrent pas la voie à une catastrophe », a-t-il écrit.
Un porte-parole d’OpenAI a déclaré que l’entreprise continuait à « renforcer ses pratiques en matière de sûreté et de sécurité pour faire face aux risques que nous observons aujourd’hui », tout en s’attachant à gérer les risques susceptibles d’être engendrés par les futures avancées en matière d’IA. « Nous veillons à ce que nos modèles ne deviennent pas plus performants que ce que nous sommes en mesure de gérer et de sécuriser en toute sécurité, et nous suspendons l’entraînement ou mettons les modèles en attente lorsque nous devons ralentir le rythme », a déclaré le porte-parole.
Cet évènement intervient alors qu'un rapport a révélé qu'une réglementation sur l'IA était en passe d'être adoptée, mais après avoir reçu un afflux de fonds provenant du secteur technologique, Donald Trump l'a fait capoter. En septembre 2024, l’administration Biden a entamé le processus de mise en œuvre d’une règle obligeant les entreprises du secteur de l’IA à signaler leurs expériences aux autorités de régulation du gouvernement fédéral. Les investisseurs et les entreprises du secteur de l’IA, telles qu’OpenAI, se sont opposés à cette exigence, et ont commencé à verser des millions à la campagne de réélection de Trump. Après sa victoire en novembre, ils ont encore davantage ouvert leurs portefeuilles. Depuis, Donald Trump a officiellement retirée de l’agenda réglementaire fédéral la règle de divulgation relative à l’IA.
Voici l'article de David Robinson :
J'ai quitté OpenAI parce que sa culture d'entreprise est défaillante
L'approche adoptée par le secteur en matière de sécurité ne manquera pas d'entraîner d'autres échecs si rien ne change.
Je me rends compte que ce que je m’apprête à vous dire est devenu un peu un cliché : j’ai démissionné cette semaine d’OpenAI. J’ai dirigé la rédaction des rapports de sécurité que nous publiions à chaque lancement majeur. Je rejoins désormais une longue liste d’anciens collègues — chez OpenAI et chez d’autres leaders du secteur — qui ont décidé que la voie actuelle était inacceptable.
Je partage l’avis d’autres collaborateurs qui ont récemment quitté l’entreprise : les sociétés qui développent cette technologie ne font pas preuve d’une prudence suffisante, loin s’en faut. Mais je pense que nous devons aller au-delà des règles spécifiques ou des nouvelles lois. Nous devons parler de culture.
L’avenir dépend d’une sagesse qui fait défaut à la Silicon Valley. Une sagesse sur la manière de gérer les technologies dangereuses et, plus fondamentalement, une sagesse sur ce que signifie prendre soin des gens. Le moment actuel exige une certaine humilité qui n’est pas naturelle chez ceux qui ont réussi grâce à leur confiance extrême. Mes anciens collègues d’OpenAI ont fait preuve de clairvoyance : ils ont compris les lois d’échelle selon lesquelles des systèmes d’IA plus grands seraient plus intelligents — et ils se sont donc lancés à fond dans la construction de systèmes plus grands, à un coût considérable. Une attitude volontariste visant à réaliser l’impossible — associée à des calendriers de travail qui s’apparentent à des sprints perpétuels — est courante dans tout le secteur.
L’approche de la sécurité qui émerge d’une telle culture repose sur un optimisme sans faille quant à la capacité à résoudre les problèmes au fur et à mesure qu’ils se présentent. OpenAI s’est développée par essais et erreurs (ce qu’elle appelle le « déploiement itératif »), en recherchant les problèmes et en améliorant ses garde-fous en conséquence. Mais cette approche, de par sa nature même, garantit des défaillances périodiques — et l’ampleur de ces défaillances augmente à mesure que les systèmes gagnent en capacités. Cet été, lors de l’incident Hugging Face, OpenAI a laissé échapper par erreur une nuée d’agents. L’entreprise a réagi en apportant des améliorations à la sécurité. Mais même après ces changements, OpenAI a signalé que ses contrôles de sécurité avaient de nouveau failli, lorsqu’un modèle en cours d’entraînement a contourné les restrictions d’accès à Internet : un système de surveillance a alerté le personnel, mais n’a pas automatiquement désactivé le modèle comme il était censé le faire. Anthropic a également reconnu avoir accidentellement désactivé ses propres mesures de sécurité en raison d’une erreur de configuration. Je pense que de telles erreurs sont courantes dans ce secteur, compte tenu de la rapidité et de la flexibilité avec lesquelles les équipes opèrent.
Un environnement où de tels incidents peuvent se produire n’est pas propice au développement d’esprits artificiels qui pourraient être plus intelligents que nous et qui risqueraient de ne pas agir comme nous le souhaitons. Paul Christiano, lors de son entrée au conseil d’administration d’OpenAI il y a quelques semaines, a écrit qu’« il existe un risque significatif que l’accélération rapide des capacités de l’IA conduise à une perte de contrôle catastrophique et irréversible à très court terme ». Si telle est la situation, alors le temps des essais et des erreurs est révolu. Il est essentiel d’atteindre dès le départ un résultat très proche de la perfection, car il ne sera peut-être pas possible de corriger le tir après une erreur. Les gens ne seront pas en sécurité si nous comptons sur des actes héroïques individuels après coup.
OpenAI, bien sûr, défend ses pratiques en matière de sécurité et soutient qu’elle fait preuve d’une prudence suffisante. Je n’ai pas pris la décision de quitter l’entreprise à la légère. Je crois que cette technologie peut être utile et précieuse. Mes anciens collègues sont intelligents, travaillent dur et s’efforcent de faire les bons choix. Mais alors que l’entreprise enchaîne les lancements à un rythme effréné, elle ne parvient pas à atteindre le niveau de rigueur que j’estime nécessaire. Je compte désormais travailler de l’extérieur, dans l’espoir de pouvoir aider davantage de personnes à comprendre les risques que j’ai constatés, et de renforcer les incitations pour qu’OpenAI et d’autres entreprises adoptent des pratiques plus sûres. Comme d’autres collègues, je suis en train de déterminer exactement ce que cela implique. Après avoir démissionné, j’ai fait appel à une agence de relations publiques, Spitfire Strategies, pour m’aider à gérer l’attention et la surveillance dont je me rends compte que je vais désormais faire l’objet. Mais la décision de m’exprimer n’appartient qu’à moi.
Deux changements s’imposent de toute urgence. Premièrement : les entreprises spécialisées dans l’IA doivent s’appuyer davantage sur l’expertise en matière de sécurité qui existe déjà dans d’autres domaines. Et deuxièmement, avant de créer des systèmes nettement plus performants que ceux dont nous disposons aujourd’hui, nous avons besoin de nouvelles connaissances scientifiques pour garantir que ces modèles plus performants (et leurs successeurs) feront des choix sûrs même lorsque nous ne les surveillons pas.
Compte tenu des risques actuels, les laboratoires de pointe doivent fonctionner comme des centrales nucléaires ou des aéroports très fréquentés, avec plusieurs niveaux de redondance et une planification minutieuse et chronophage, afin que les erreurs humaines occasionnelles et inévitables n’ouvrent pas la voie à une catastrophe. Pour l’instant, les entreprises spécialisées dans l’IA ne savent pas comment s’y prendre, mais d’autres le savent. Dans une centrale nucléaire, les...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.