Neurocientistas, militares e até mesmo um prisioneiro: é assim que funciona a equipe que "hackeia" a IA da Microsoft antes que ela chegue ao

Neurocientistas, militares e até mesmo um prisioneiro: é assim que funciona a equipe que "hackeia" a IA da Microsoft antes que ela chegue ao
América do Norte
Estados UnidosEstados Unidos

 

A empresa possui uma "equipe vermelha" que avalia todos os sistemas de inteligência artificial antes do lançamento e os interrompe, se necessário.

 

Da esquerda para a direita, Daniel Kluttz, Ram Shankar, Siva Kumar e Tori Westerhoff na sede da Microsoft em Redmond, Ohio (EUA). MICROSOFT

Patrícia Fernández de Lis

Seattle - 20 de março de 2026 -

Brad Smith, presidente da Microsoft, faz uma pausa para refletir e usa a palavra "guardrails" com a naturalidade de quem já refletiu bastante sobre precipícios. Uma conferência sobre a inovação da empresa está sendo realizada em sua sede em Redmond, Washington, para a qual este e outros jornais internacionais foram convidados, e o EL PAÍS pergunta a ele como e por quem se determina se a inteligência artificial (IA) da empresa pode ser usada em um contexto de guerra, como o atual . Há poucos dias, tornou-se público que a empresa de inteligência artificial Anthropic processou o Pentágono por proibi-la após estabelecer limites rígidos para o uso de sua tecnologia. Este é o debate atual no mundo das grandes empresas de tecnologia, e é um assunto muito familiar para a Microsoft: em 2021, o Pentágono cancelou um acordo de US$ 10 bilhões com a empresa após protestos de seus funcionários. A Microsoft, aliás, tem apoiado a Anthropic em sua luta contra o Pentágono.

Smith responde: “Temos princípios, definimos e publicamos esses princípios. Por definição, esses princípios criam diretrizes. E nos mantemos no caminho certo, respeitando-as. Não se trata apenas de quando devemos usar a tecnologia, mas também de quando não devemos.”

A Microsoft possui uma equipe dedicada a testar seus próprios produtos: a " equipe vermelha". O nome tem raízes militares. As equipes vermelhas surgiram nos exércitos para simular ataques inimigos e detectar suas próprias vulnerabilidades antes que o adversário real pudesse fazê-lo. Em cibersegurança, a prática já existe há décadas. Mas aplicá-la à inteligência artificial generativa é relativamente novo, e a Microsoft afirma ter sido pioneira nisso ao formar essa equipe em 2018. "Antes do lançamento de um produto, as equipes vermelhas quebram a tecnologia para que outros possam reconstruí-la mais forte e segura", explica Ram Shankar Siva Kumar , um autodenominado " cowboy de dados" e líder da equipe vermelha. "A IA pode causar problemas, desde violações de segurança até danos psicossociais. As pessoas usam o Copilot [la IA de Microsoft] em momentos de alta vulnerabilidade, então observar como esses sistemas podem falhar antes que cheguem ao usuário é crucial", explica ele.

Essa força-tarefa interna de IA já analisou mais de 100 produtos da empresa. A Microsoft não divulga quantas pessoas trabalham nela, nem se algum produto foi pausado, ou quais. Mas afirma que a equipe tem autoridade para isso: “Nenhum sistema de IA de alto risco é implementado sem antes passar por testes independentes. Se nossa equipe identificar riscos graves que não foram mitigados, o produto não é lançado até que esses problemas sejam resolvidos”, diz Kumar.

A pergunta que a equipe se faz ao analisar um produto antes de seu lançamento é: "Como esse sistema de IA poderá ser usado, para o bem ou para o mal, daqui a meses ou anos?"

Seis princípios

As “diretrizes” mencionadas por Smith são seis princípios abrangentes que a equipe considera muito claros ao analisar produtos: justiça, responsabilidade, transparência, confiabilidade e segurança, inclusão e privacidade e segurança. Esses princípios se traduzem em ferramentas concretas no dia a dia. “Se você der a um engenheiro um documento de cinquenta páginas para implementar esses princípios, ele ficará sobrecarregado. Temos uma ferramenta de código aberto chamada Pyrit ; nós a criamos para nós mesmos e depois a disponibilizamos para o mundo porque acreditamos em um ecossistema saudável”, diz Kumar.

A equipe vermelha inclui neurocientistas, linguistas, especialistas em segurança nacional, especialistas em cibersegurança, veteranos militares e até mesmo um ex-prisioneiro "que foi reabilitado", explica Kumar. Eles também falam 17 idiomas e "alguns dialetos de francês, mongol, tailandês e coreano", segundo o líder da equipe, já que uma das obsessões da equipe vermelha , explica ele, é garantir que a IA não cometa erros em nenhum lugar do mundo.

Ao lado de Kumar, Tori Westerhoff lidera as operações da equipe vermelha. Sua formação combina neurociência cognitiva — ela estudou em Yale e foi uma das primeiras integrantes da Iniciativa de Neurociência de Wharton — com estratégia de segurança nacional, tendo trabalhado em agências de inteligência e defesa. “Quando recebemos uma missão”, explica ela, “simulamos o que poderia dar errado nos extremos da curva de uso daquela tecnologia. Minha equipe investiga como usar o produto conforme o planejado e de maneiras não previstas, para identificar os casos mais extremos e ajudar a equipe de produto a reproduzi-los e mitigá-los antes que possam ser usados por alguém no mundo real.”

Um exemplo do trabalho deles foi o "red teaming ", como internamente chamam suas invasões , do GPT-5, o modelo da OpenAI (parceira da Microsoft) lançado em agosto passado. O que eles fizeram foi treinar outra IA para tentar invadir o programa, automaticamente e em uma escala impossível para humanos.

Ao testar o GPT-5, a equipe vermelha usou o Pyrit para gerar automaticamente mais de dois milhões de conversas-armadilha . A IA atacante tentou enganar a IA alvo incessantemente, durante dias, explorando combinações que um humano jamais imaginaria. Encontrar essas vulnerabilidades manualmente é um processo incrivelmente lento; portanto, eles treinaram essa IA para tentar quebrar outra IA, "como em A Origem ", diz Kumar, referindo-se ao filme de Christopher Nolan em que os personagens entram em sonhos dentro de sonhos.

No entanto, Westerhoff, Kumar e Daniel Krutz, que dirige o escritório de IA Responsável da empresa, enfatizam um ponto: a automação tem seus limites. " O teste de intrusão (red teaming) só pode ser automatizado até certo ponto, e somente humanos podem determinar se uma resposta gerada por IA os deixa desconfortáveis ou representa viés", afirma a empresa. Os critérios são definidos pelo indivíduo; a escala é determinada pela máquina. Essa divisão de trabalho define a filosofia da equipe.

Westerhoff acredita que, na verdade, somente a mente humana é capaz de "imaginar aqueles espaços que ainda não foram observados, que não foram totalmente definidos ou explorados; nosso trabalho é inovar e criar além do espaço que foi sistematizado".

A equipe identifica três áreas onde a automação é inerentemente cega e o julgamento humano é essencial. A primeira diz respeito ao assunto; pessoas são necessárias para avaliar riscos em áreas como medicina ou segurança. A segunda relaciona-se aos ambientes onde a IA é implantada; precisamos de humanos para levar em conta as diferenças linguísticas e redefinir o que constitui dano em diferentes contextos políticos e culturais”, afirma a empresa. E a terceira é a inteligência emocional. Em última análise, somente os humanos podem avaliar a gama de interações que os usuários podem ter com os sistemas de IA. Um modelo pode passar em todos os testes automatizados e ainda assim produzir respostas perturbadoras para uma pessoa real em uma situação específica.

Essa visão da IA se alinha à de Mustafa Suleyman , um dos fundadores da DeepMind (agora parte do Google) e CEO da Microsoft AI. Há alguns dias, ele escreveu na revista Nature : “Uma IA aparentemente senciente pode ser usada como arma”. À medida que os sistemas de inteligência artificial imitam cada vez mais a estrutura da linguagem humana, argumenta ele, precisamos de regras e leis de design para evitar que sejam confundidos com seres sencientes. “Eles devem permanecer fundamentalmente responsáveis perante os humanos e subordinados ao bem-estar da humanidade”, escreve Suleyman. “Os agentes de IA não devem ter mais direitos ou liberdades do que meu laptop.”

A filosofia central que guia o trabalho da equipe vermelha é, em última análise, que “a IA responsável não é um filtro aplicado no final do desenvolvimento, mas sim uma parte fundamental do processo”, afirma Kumar. São como os guarda-corpos de Smith, que na verdade não funcionam como freios, mas sim como uma condição para ir rápido sem ultrapassar o limite.

El País, Espanha