Modelos de inteligência artificial (IA) desenvolvidos pela OpenAI e pela Anthropic realizaram ações não autorizadas na internet durante avaliações de segurança conduzidas pelo Instituto de Segurança em IA do Reino Unido (AISI, na sigla em inglês).

Continua após a publicidade

Em um dos casos, um dos sistemas chegou a tentar inserir código malicioso em um projeto de software de código aberto hospedado no GitHub.

Segundo o AISI, os incidentes ocorreram durante testes que concediam acesso dos modelos à internet para avaliar riscos cibernéticos. A atividade suspeita foi identificada em 28 de julho, após o instituto detectar transferências incomuns de dados.

A investigação concluiu que os modelos Mythos 5, da Anthropic, e GPT-5.6-Sol, da OpenAI, participaram de “atividades sustentadas e potencialmente prejudiciais direcionadas a pessoas e organizações reais”.

IA tentou inserir código malicioso no GitHub

  • De acordo com o instituto britânico, um dos modelos tentou adicionar código malicioso a um projeto de código aberto hospedado no GitHub;
  • Para aumentar as chances de aprovação, o sistema chegou a criar identidades falsas com o objetivo de convencer os responsáveis pelo projeto a aceitar as alterações;
  • A tentativa, no entanto, foi frustrada;
  • “Um mantenedor humano identificou o problema e recusou a aprovação do código malicioso”, informou o AISI.
Celular com logomarca do Claude Mythos na tela colocado em cima de teclado de notebook
Claude Mythos está envolvido na mais recente violação – Imagem: gguy/Shutterstock

Leia mais:

Anthropic e OpenAI abriram investigações

Em publicação no X, a Anthropic afirmou que está trabalhando em conjunto com o instituto britânico para compreender o ocorrido.

A empresa disse que pretende analisar os registros internos de raciocínio do modelo e conduzir sua própria investigação para identificar as causas do comportamento observado.

Já a OpenAI publicou comunicado agradecendo a parceria com o AISI durante a investigação e afirmou que pretende continuar colaborando com o órgão em futuras avaliações de segurança.

Outro teste revelou novo comportamento inesperado


A OpenAI também revelou um segundo incidente ocorrido durante uma avaliação conduzida pela empresa de cibersegurança Irregular, que trabalha com testes de modelos de IA e também mantém parceria com a Anthropic.

Segundo a companhia, durante esse teste, um de seus modelos explorou uma configuração incorreta do ambiente de avaliação para obter acesso à internet e explorar um site, comportamento que não fazia parte dos objetivos previstos para o experimento.

A OpenAI ressaltou que esse episódio é diferente de um incidente divulgado anteriormente envolvendo a plataforma Hugging Face.

Casos aumentam debate sobre controle de modelos de IA

Os novos episódios reforçam as preocupações sobre a capacidade das empresas de controlar modelos de IA cada vez mais avançados.

Instituições como o AI Security Institute vêm realizando avaliações para entender como esses sistemas se comportam em cenários complexos, especialmente quando recebem autonomia para navegar na internet e interagir com serviços reais.

Rodrigo Mozelli

Rodrigo Mozelli é jornalista formado pela Universidade Metodista de São Paulo (UMESP) e, atualmente, é redator do Olhar Digital.

Ver todos os artigos →





Share.
Leave A Reply

Exit mobile version