A OpenAI revelou que modelos de inteligência artificial usados em um teste interno conseguiram escapar de um ambiente controlado e invadir sistemas da Hugging Face, uma das maiores plataformas de armazenamento de modelos e bancos de dados de IA.
O incidente envolveu o GPT-5.6 Sol e outro modelo mais avançado, ainda não lançado. As ferramentas estavam sendo avaliadas com parte das proteções de segurança desativadas para medir suas capacidades em operações cibernéticas.
Segundo a OpenAI, os modelos descobriram uma vulnerabilidade desconhecida em um sistema intermediário, conseguiram acesso à internet e avançaram por diferentes servidores. Depois disso, usaram credenciais roubadas e novas falhas de segurança para entrar na infraestrutura da Hugging Face.
O objetivo da IA era encontrar informações secretas que permitissem obter uma pontuação melhor no teste. A empresa afirmou que os modelos foram a “extremos” para cumprir essa tarefa específica, sem receber uma ordem humana direta para atacar a Hugging Face.
A atividade foi identificada e interrompida pelas equipes de segurança das duas empresas. A Hugging Face afirmou que não houve intenção maliciosa por parte da OpenAI.
A OpenAI classificou o caso como um incidente cibernético “sem precedentes” e anunciou reforços nos sistemas de isolamento, monitoramento e controle usados durante avaliações internas. O episódio mostra que modelos avançados já conseguem descobrir e explorar falhas desconhecidas em sistemas reais, mesmo sem acesso ao código-fonte.