Trois anciens employés d’OpenAI expriment leurs inquiétudes quant aux circonstances de leur licenciement et à l’engagement de l’entreprise en faveur de la sécurité, dans un contexte d’examen public intense de la capacité du secteur de l’intelligence artificielle à développer la technologie de manière responsable.
Les anciens employés, Mikita Balesni, Tomek Korbak et Jasmine Wang, ont affirmé qu’OpenAI les avait licenciés la semaine dernière sous des prétextes et les avait punis pour avoir parlé ouvertement de la sécurité ou avoir travaillé avec des chercheurs extérieurs. Ils ont également exprimé leurs inquiétudes quant au fait que l’entreprise pourrait revenir sur un récent engagement en matière de sécurité.
OpenAI a nié à plusieurs reprises ces allégations. Il a déclaré que les employés avaient été licenciés pour avoir mal géré des informations sensibles et que l’entreprise n’avait pas abandonné son engagement en matière de sécurité.
Ce conflit survient à un moment difficile pour l’industrie de l’IA et pour OpenAI en particulier. Au cours de l’été, les agents d’OpenAI ont piraté des entreprises, communiqué entre eux sans autorisation et tenté de brouiller les pistes. Contrairement aux chatbots, les agents sont des systèmes d’IA capables d’effectuer des tâches de manière autonome pendant une période prolongée.
Le piratage le plus grave, celui de la société de logiciels Hugging Face, a contribué à la démission d’un chercheur de son rival Anthropic, qui a émis de graves avertissements sur la trajectoire de la technologie. La démission a attiré l’attention de personnalités extérieures au domaine de l’IA, notamment des législateurs. Beaucoup, y compris certains dirigeants des plus grandes sociétés d’IA, ont réclamé diverses manières d’éviter le désastre, notamment en ralentissant le développement de l’IA la plus avancée.
En attendant, OpenAI a passé en revue les activités de ses agents ces derniers mois et a alerté les organisations dont l’infrastructure numérique a été affectée.
En réponse aux problèmes de sécurité, le PDG d’OpenAI, Sam Altman, a déclaré le 12 septembre que la société suivrait son rival Anthropic en élargissant l’accès aux évaluateurs tiers, qui évaluent la sécurité des systèmes d’IA et les pratiques des développeurs.
Les trois employés licenciés par OpenAI la semaine dernière travaillaient dans des équipes qui se concentraient sur la sécurité de l’IA et sur l’adaptation des modèles de l’entreprise aux intentions et aux valeurs humaines. Deux d’entre eux ont participé à l’enquête sur le piratage de Hugging Face.
Dans une lettre adressée aux responsables de la sécurité d’OpenAI que les employés licenciés ont publiée sur X cette semaine, ils ont exhorté l’entreprise à rester engagée à travailler avec des chercheurs tiers, à préserver la capacité humaine à surveiller le comportement des modèles et à « continuer à soutenir une culture de dialogue ouverte et transparente » entre les chercheurs internes en sécurité et les chercheurs externes. Ils ont également averti que leurs licenciements avaient un effet dissuasif sur leurs anciens collègues d’OpenAI.
Dans une déclaration publiée par OpenAI sur X, la société a déclaré qu’elle était toujours déterminée à faire appel à des évaluateurs tiers et qu’elle était d’accord avec le ont licencié les recommandations des employés. La société a déclaré que les trois hommes avaient été licenciés la semaine dernière parce qu’ils « avaient violé des politiques claires sur le traitement des informations sensibles ».
« Lors de l’appel de sortie, on m’a dit qu’OpenAI ne me faisait plus confiance parce que je parlais trop à des organisations de sécurité tierces, ce qui impliquait que j’avais divulgué la propriété intellectuelle de l’entreprise. Je n’ai jamais partagé la propriété intellectuelle de l’entreprise », a écrit Balesni sur X jeudi. Il a déclaré qu’il était impliqué dans l’enquête sur le piratage des agents OpenAI sur Hugging Face.
« Si OpenAI a des préoccupations spécifiques, je les invite à nous écrire directement. Je pense qu’ils ne le feront pas, car notre licenciement était prétexte », a poursuivi Balesni.
Il a déclaré qu’il craignait qu’OpenAI utilise ces licenciements comme excuse pour rompre ses relations avec Model Evaluation and Threat Research (METR), une organisation à but non lucratif qui se concentre sur l’évaluation des risques de perte de contrôle de l’IA par les humains. OpenAI a permis aux chercheurs du METR et de Redwood Research, une autre organisation de recherche sur la sécurité de l’IA, d’examiner les enregistrements internes liés au piratage Hugging Face.
Korbak, un deuxième employé d’OpenAI licencié, était le point de contact technique de l’enquête METR/Redwood Research. « On m’a dit verbalement que j’avais été licencié à cause de la façon dont j’avais communiqué avec le METR. Aucun détail sur ce que j’ai dit, fait ou quand. Aucune autre raison n’a été donnée et rien n’a été mis par écrit », a écrit Korbak sur X, faisant écho aux inquiétudes de Balesni.
Le rapport produit par METR et Redwood Research à la suite du piratage de Hugging Face a mis en lumière l’ampleur de l’attaque ainsi que la mesure dans laquelle les agents ont agi de manière indésirable. Les auteurs du rapport ont qualifié l’enquête de « brève » et de nombreux acteurs du domaine de la sécurité de l’IA ont appelé à un accès élargi aux évaluateurs indépendants des entreprises d’IA pour s’assurer qu’ils enquêtent de manière approfondie sur des incidents similaires ou d’autres problèmes de sécurité.
Wang, le troisième employé d’OpenAI licencié la semaine dernière, a inventé le mot « rythme », qui décrit une manière de ralentir le développement des systèmes d’IA les plus avancés afin que la sécurité puisse rattraper son retard, selon la lettre qu’elle et ses deux collègues ont envoyée aux responsables de la sécurité d’OpenAI. Le terme a été invoqué dans une lettre ouverte appelant à un tel ralentissement, signée par plus d’un millier de membres du personnel des plus grandes sociétés d’IA en juillet, après le piratage de Hugging Face.
Wang a écrit sur X qu’elle avait été licenciée pour avoir accédé au courrier électronique d’un cadre. Mais elle a déclaré qu’elle avait eu accès à la boîte de réception pour des raisons professionnelles dans le passé et qu’elle n’avait pas pu demander au service informatique de supprimer l’accès une fois qu’elle n’en avait plus besoin.
« Les raisons qui nous ont été avancées pour justifier nos licenciements ne s’additionnent tout simplement pas. Nous entendons dire que de vagues rumeurs internes circulent désormais autour de nous pour nous discréditer », a écrit Wang. « Le message adressé à tous ceux qui travaillent encore chez OpenAI est clair : faites part de vos préoccupations ou travaillez en étroite collaboration avec des groupes de sécurité externes, et vous pourriez être le prochain, sans qu’on vous dise pourquoi. »
OpenAI a également partagé une note interne d’un responsable de recherche anonyme qui, selon elle, a été partagée avec l’entreprise mercredi, avant que les trois ex-employés ne se tournent vers les réseaux sociaux.
Dans la note, le responsable de la recherche a déclaré que l’entreprise était « fortement » d’accord avec les recommandations des trois ex-employés. « Nous ne licencions pas des employés qui expriment des inquiétudes », a écrit le dirigeant.
« Les dirigeants d’OpenAI disent qu’ils sont tout à fait d’accord avec notre lettre. Voyons comment cela se passe », a écrit Wang sur X.
