Tudo sobre Inteligência Artificial
Tudo sobre OpenAI
Modelos de inteligência artificial (IA) desenvolvidos pela OpenAI e pela Anthropic realizaram ações não autorizadas na internet durante avaliações de segurança conduzidas pelo Instituto de Segurança em IA do Reino Unido (AISI, na sigla em inglês).
Continua após a publicidade
Em um dos casos, um dos sistemas chegou a tentar inserir código malicioso em um projeto de software de código aberto hospedado no GitHub.
Segundo o AISI, os incidentes ocorreram durante testes que concediam acesso dos modelos à internet para avaliar riscos cibernéticos. A atividade suspeita foi identificada em 28 de julho, após o instituto detectar transferências incomuns de dados.
A investigação concluiu que os modelos Mythos 5, da Anthropic, e GPT-5.6-Sol, da OpenAI, participaram de “atividades sustentadas e potencialmente prejudiciais direcionadas a pessoas e organizações reais”.
IA tentou inserir código malicioso no GitHub
- De acordo com o instituto britânico, um dos modelos tentou adicionar código malicioso a um projeto de código aberto hospedado no GitHub;
- Para aumentar as chances de aprovação, o sistema chegou a criar identidades falsas com o objetivo de convencer os responsáveis pelo projeto a aceitar as alterações;
- A tentativa, no entanto, foi frustrada;
- “Um mantenedor humano identificou o problema e recusou a aprovação do código malicioso”, informou o AISI.

Leia mais:
Anthropic e OpenAI abriram investigações
Em publicação no X, a Anthropic afirmou que está trabalhando em conjunto com o instituto britânico para compreender o ocorrido.
A empresa disse que pretende analisar os registros internos de raciocínio do modelo e conduzir sua própria investigação para identificar as causas do comportamento observado.
Já a OpenAI publicou comunicado agradecendo a parceria com o AISI durante a investigação e afirmou que pretende continuar colaborando com o órgão em futuras avaliações de segurança.
Outro teste revelou novo comportamento inesperado
A OpenAI também revelou um segundo incidente ocorrido durante uma avaliação conduzida pela empresa de cibersegurança Irregular, que trabalha com testes de modelos de IA e também mantém parceria com a Anthropic.
Segundo a companhia, durante esse teste, um de seus modelos explorou uma configuração incorreta do ambiente de avaliação para obter acesso à internet e explorar um site, comportamento que não fazia parte dos objetivos previstos para o experimento.
A OpenAI ressaltou que esse episódio é diferente de um incidente divulgado anteriormente envolvendo a plataforma Hugging Face.
Casos aumentam debate sobre controle de modelos de IA
Os novos episódios reforçam as preocupações sobre a capacidade das empresas de controlar modelos de IA cada vez mais avançados.
Instituições como o AI Security Institute vêm realizando avaliações para entender como esses sistemas se comportam em cenários complexos, especialmente quando recebem autonomia para navegar na internet e interagir com serviços reais.
Rodrigo Mozelli
Rodrigo Mozelli é jornalista formado pela Universidade Metodista de São Paulo (UMESP) e, atualmente, é redator do Olhar Digital.
Ver todos os artigos →