Um grupo de três pesquisadores de segurança, utilizando o modelo Claude Opus 5 da Anthropic, conseguiu comprometer sistemas internos da OpenAI em menos de 72 horas. O feito destaca não apenas a evolução das capacidades dos modelos de IA, mas também os riscos crescentes para a segurança digital em um cenário onde as fronteiras entre defesa e ataque se tornam cada vez mais tênues.
O Exploit que Mudou o Jogo
O ataque começou com uma vulnerabilidade crítica em uma biblioteca de processamento de imagens amplamente utilizada: o libheif, responsável por decodificar arquivos HEIC e HEIF, comuns em dispositivos Apple. Pesquisadores da Hacktron AI descobriram uma falha de corrupção de memória (heap buffer overflow) nessa biblioteca, presente no ambiente do fórum da comunidade do OpenAI, que rodava sobre o sistema Discourse.
Inicialmente, os pesquisadores tentaram explorar essa vulnerabilidade usando o modelo anterior da Anthropic, o Claude Opus 4.8. No entanto, o modelo enfrentou dificuldades para produzir um exploit confiável, especialmente devido à randomização de layout de endereços (ASLR), uma técnica de segurança que impede ataques baseados em memória.
Tudo mudou com o lançamento do Claude Opus 5, em 24 de julho de 2026. Em questão de horas, o novo modelo conseguiu gerar um exploit funcional para arquitetura ARM64 e, posteriormente, adaptá-lo para o ambiente x86-64 do Discourse. Segundo os pesquisadores, o Opus 5 não apenas identificou a vulnerabilidade, mas também operou de forma autônoma para refinar e executar o ataque, demonstrando um avanço significativo em termos de capacidade de resolução de problemas complexos.
Como o Ataque Funcionou
A equipe da Hacktron AI iniciou o ataque carregando uma imagem HEIF maliciosa no fórum da comunidade do OpenAI. Ao processar essa imagem, a vulnerabilidade no libheif foi acionada, permitindo a execução remota de código (RCE) no servidor do fórum. A partir daí, os pesquisadores exploraram uma segunda falha: uma configuração incorreta no sistema de autenticação única (SSO) do OpenAI.
Essa falha permitiu que eles assumissem a identidade de um funcionário do OpenAI e acessassem contas vinculadas ao ChatGPT e Codex. Para demonstrar o impacto sem causar danos reais, os pesquisadores usaram a conta comprometida para criar uma solicitação de alteração (pull request) inofensiva no repositório interno do OpenAI, comprovando assim o acesso aos sistemas críticos da empresa.
“Opus 4.8 lutou em várias sessões para produzir um exploit funcional. Dentro de horas após o lançamento do Opus 5, demos o mesmo problema para ele, e ele teve sucesso.” — Hacktron AI
Impacto e Repercussões
O incidente não resultou em vazamento de dados ou prejuízos significativos, pois os pesquisadores agiram de forma ética e responsável, reportando a vulnerabilidade por meio do programa de bug bounty do OpenAI. A empresa confirmou a correção da falha e pagou uma recompensa de $6.500 aos pesquisadores.
No entanto, o caso levantou sérias questões sobre a segurança de sistemas que dependem de bibliotecas de código aberto e sobre as capacidades crescentes dos modelos de IA em explorar vulnerabilidades. Especialistas alertam que, se um pequeno grupo de pesquisadores conseguiu comprometer a segurança do OpenAI, empresas menos preparadas podem estar em risco ainda maior.
Matt Fredrikson, CEO da empresa de segurança Gray Swan, afirmou ao TechCrunch: “Por $200 por mês, qualquer pessoa pode usar essas ferramentas e hackear uma empresa como o OpenAI. Se isso pode acontecer com eles — e não acho que eles estejam negligenciando recentemente em termos de higiene cibernética — isso pode acontecer com qualquer um.”
Claude Opus 5: Mais Capacidades, Mais Riscos
O lançamento do Claude Opus 5 pela Anthropic trouxe não apenas melhorias significativas em termos de desempenho e capacidade de resolução de problemas, mas também desafios em relação à segurança. Enquanto modelos anteriores, como o Opus 4.8, enfrentavam limitações ao tentar explorar vulnerabilidades, o Opus 5 demonstrou uma habilidade sem precedentes em operacionalizar exploits complexos.
Embora o Opus 5 mantenha guardas de segurança mais rigorosas do que modelos como o Mythos 5 — que foi temporariamente bloqueado devido a preocupações com suas capacidades ofensivas de cibersegurança — ele ainda representa um avanço significativo. A Anthropic implementou recursos como fallbacks automáticos, que redirecionam solicitações suspeitas para modelos menos potentes, reduzindo o risco de uso indevido.
Além disso, o Opus 5 é livre de políticas de retenção de dados mais restritivas, como as aplicadas ao Mythos 5, o que pode atrair usuários preocupados com privacidade, mas também aumenta o potencial de uso em cenários não autorizados.
O Futuro da Segurança Digital
Esse incidente reforça a necessidade de empresas investirem em auditorias de segurança robustas, especialmente em bibliotecas de código aberto e sistemas de autenticação. Além disso, a comunidade de IA deve continuar desenvolvendo mecanismos de segurança proativos para garantir que os avanços tecnológicos não sejam acompanhados por riscos incontroláveis.
À medida que modelos como o Claude Opus 5 se tornam mais sofisticados, a linha entre ferramentas de defesa e ataque se desfoca. Como observou um especialista em IA nas redes sociais: “Se três pessoas podem fazer isso, o que um estado-nação é capaz de realizar?”
O caso do OpenAI serve como um lembrete urgente: a segurança digital não pode ser deixada para trás na corrida pela inteligência artificial.