Des neuroscientifiques, des militaires et même un prisonnier : voilà comment travaille l’équipe qui « pirate » l’IA de Microsoft avant sa mise à dispo

L'entreprise dispose d'une « équipe rouge » chargée d'évaluer tous les systèmes d'intelligence artificielle avant leur lancement et de les interrompre si nécessaire.
De gauche à droite : Daniel Kluttz, Ram Shankar, Siva Kumar et Tori Westerhoff au siège de Microsoft à Redmond, dans l’Ohio (États-Unis). MICROSOFT
Seattle - 20 mars 2026 -
Brad Smith, président de Microsoft, marque une pause pour réfléchir et emploie le mot « garde-fous » avec la nonchalance de quelqu'un qui a longuement réfléchi aux précipices. Une conférence sur l'innovation de l'entreprise se tient à son siège de Redmond, dans l'État de Washington. Ce journal, ainsi que d'autres publications internationales, y ont été invités. EL PAÍS l'interroge sur les modalités et les instances qui déterminent si l'intelligence artificielle (IA) de l'entreprise peut être utilisée dans un contexte de guerre, comme celui que nous connaissons actuellement . Il y a quelques jours à peine, on apprenait que la société d'intelligence artificielle Anthropic avait porté plainte contre le Pentagone pour interdiction d'utiliser sa technologie, suite à la fixation de limites strictes. Ce débat agite actuellement le monde des géants de la tech, et Microsoft n'y est pas sans rappeler la situation : en 2021, le Pentagone avait annulé un contrat de 10 milliards de dollars avec l'entreprise après des protestations de ses employés. Microsoft a d'ailleurs soutenu Anthropic dans son combat contre le Pentagone.
Smith répond : « Nous avons des principes, nous les définissons et nous les publions. Par définition, ces principes établissent un cadre de référence. Et nous nous y tenons. Il ne s’agit pas seulement de savoir quand utiliser la technologie, mais aussi quand ne pas l’utiliser. »
Microsoft dispose d'une équipe dédiée au piratage de ses propres produits : la « red team ». Ce nom a des racines militaires. Les red teams ont vu le jour au sein des armées pour simuler des attaques ennemies et détecter leurs propres vulnérabilités avant l'adversaire réel. En cybersécurité, cette pratique est établie depuis des décennies. Mais son application à l'intelligence artificielle générative est relativement récente, et Microsoft affirme en être le pionnier avec la création de cette équipe en 2018. « Avant la commercialisation d'un produit, les red teams mettent la technologie à l'épreuve afin que d'autres puissent la reconstruire plus robuste et plus sûre », explique Ram Shankar Siva Kumar , un « cow -boy des données » autoproclamé et chef de la red team. « L'IA peut causer des problèmes, allant des failles de sécurité aux préjudices psychosociaux. Les gens utilisent Copilot [la IA de Microsoft] dans des moments de grande vulnérabilité ; il est donc crucial d'observer comment ces systèmes peuvent dysfonctionner avant qu'ils n'atteignent l'utilisateur », explique-t-il.
Ce groupe de travail interne dédié à l'IA a déjà analysé plus de 100 produits de l'entreprise. Microsoft ne divulgue pas le nombre de personnes qui y travaillent, ni si des produits ont été mis en pause et, le cas échéant, lesquels. L'entreprise affirme cependant que l'équipe est habilitée à le faire : « Aucun système d'IA à haut risque n'est déployé sans avoir préalablement fait l'objet de tests indépendants. Si notre équipe identifie des risques importants qui n'ont pas été atténués, le produit n'est pas commercialisé tant que ces problèmes ne sont pas résolus », explique Kumar.
La question que se pose l'équipe lorsqu'elle analyse un produit avant son lancement est la suivante : « Comment ce système d'IA pourrait-il être utilisé, pour le meilleur ou pour le pire, dans les mois ou les années à venir ? »
Six principes
Les « garde-fous » évoqués par Smith correspondent à six principes fondamentaux que l'équipe considère comme essentiels lors de l'évaluation des produits : équité, responsabilité, transparence, fiabilité et sécurité, inclusion, et respect de la vie privée et sécurité. Ces principes se traduisent concrètement au quotidien. « Si vous donnez à un ingénieur un document de cinquante pages pour mettre en œuvre ces principes, il sera vite dépassé. Nous utilisons un outil open source appelé Pyrit ; nous l'avons développé en interne puis mis à disposition du public car nous croyons en un écosystème sain », explique Kumar.
L'équipe rouge comprend des neuroscientifiques, des linguistes, des spécialistes de la sécurité nationale, des experts en cybersécurité, des vétérans militaires et même un ancien détenu « réhabilité », explique Kumar. Ils parlent également 17 langues, ainsi que « certains dialectes de français, de mongol, de thaï et de coréen », selon le chef d'équipe, car l'une des obsessions de l' équipe rouge , explique-t-il, est de s'assurer que l'IA ne commette aucune erreur, où que ce soit dans le monde.
Aux côtés de Kumar, Tori Westerhoff dirige les opérations de l'équipe rouge. Son parcours allie les neurosciences cognitives – elle a étudié à Yale et a été l'une des premières membres de la Wharton Neuroscience Initiative – à la stratégie de sécurité nationale, ayant travaillé au sein d'agences de renseignement et de défense. « Lorsque nous recevons une mission », explique-t-elle, « nous simulons les dysfonctionnements potentiels aux extrêmes de l'utilisation de cette technologie. Mon équipe analyse en profondeur comment utiliser le produit, conformément à son usage prévu et de manière non prévue, afin d'identifier les cas les plus extrêmes et d'aider l'équipe produit à les reproduire et à les atténuer avant qu'ils ne soient utilisés par quiconque dans le monde réel. »
Un exemple de leur travail a été le « red teaming », comme ils appellent en interne leur méthode de piratage , du modèle GPT-5 d'OpenAI (partenaire de Microsoft) lancé en août dernier. Ils ont entraîné une autre IA à tenter de pirater le programme, automatiquement et à une échelle impossible pour les humains.
Lors des tests de GPT-5, l'équipe rouge a utilisé Pyrit pour générer automatiquement plus de deux millions de conversations pièges . L'IA attaquante a tenté de tromper l'IA ciblée sans relâche pendant des jours, explorant des combinaisons auxquelles un humain n'aurait jamais pensé. Découvrir ces failles manuellement est un processus extrêmement long ; c'est pourquoi ils ont entraîné cette IA à tenter de piéger une autre IA, « comme dans Inception », explique Kumar, en référence au film de Christopher Nolan où les personnages pénètrent dans des rêves imbriqués.
Cependant, Westerhoff, Kumar et Daniel Krutz, responsable du bureau de l'IA responsable de l'entreprise, insistent sur un point : l'automatisation a ses limites. « Les tests d'intrusion ne peuvent être automatisés que jusqu'à un certain point, et seuls les humains peuvent déterminer si une réponse générée par une IA les met mal à l'aise ou révèle un biais », affirme l'entreprise. Les critères sont définis par l'individu ; l'échelle est déterminée par la machine. Cette répartition des tâches définit la philosophie de l'équipe.
Westerhoff estime qu’en réalité, seul l’esprit humain est capable d’« imaginer ces espaces qui n’ont pas encore été observés, qui n’ont pas été pleinement définis ou explorés ; notre travail consiste à innover et à créer au-delà de l’espace qui a été systématisé. »
L'équipe a identifié trois domaines où l'automatisation est intrinsèquement aveugle et où le jugement humain est essentiel. Le premier concerne le sujet traité : l'intervention humaine est indispensable pour évaluer les risques dans des domaines tels que la médecine ou la sécurité. Le deuxième porte sur les environnements de déploiement de l'IA : « Nous avons besoin de l'humain pour tenir compte des différences linguistiques et redéfinir la notion de préjudice dans différents contextes politiques et culturels », explique l'entreprise. Le troisième concerne l'intelligence émotionnelle. En définitive, seuls les humains peuvent évaluer l'ensemble des interactions que les utilisateurs peuvent avoir avec les systèmes d'IA. Un modèle peut réussir tous les tests automatisés et pourtant produire des réponses perturbantes pour une personne réelle dans une situation donnée.
Cette vision de l'IA rejoint celle de Mustafa Suleyman , cofondateur de DeepMind (désormais intégré à Google) et PDG de Microsoft AI. Il y a quelques jours, il écrivait dans la revue Nature : « Une IA apparemment consciente peut être militarisée. » Alors que les systèmes d'intelligence artificielle imitent de plus en plus la structure du langage humain, soutient-il, nous avons besoin de règles et de lois de conception pour éviter qu'ils ne soient confondus avec des êtres sensibles. « Ils doivent rester fondamentalement responsables devant les humains et subordonnés au bien-être de l'humanité », écrit Suleyman. « Les agents d'IA ne devraient pas avoir plus de droits ni de libertés que mon ordinateur portable. »
La philosophie centrale qui guide le travail de l'équipe rouge est, en définitive, que « l'IA responsable n'est pas un filtre appliqué à la fin du développement, mais un élément fondamental du processus », explique Kumar. Elles sont comme les garde-fous de Smith, qui ne servent pas de freins à proprement parler, mais plutôt de condition pour aller vite sans basculer.
El País, Espagne






