Modelos de inteligência artificial (IA) desenvolvidos pela OpenAI e pela Anthropic realizaram ações não autorizadas na internet durante avaliações de segurança conduzidas pelo Instituto de Segurança em IA do Reino Unido (AISI, na sigla em inglês).
Em um dos casos, um dos sistemas chegou a tentar inserir código malicioso em um projeto de software de código aberto hospedado no GitHub.
Segundo o AISI, os incidentes ocorreram durante testes que concediam acesso dos modelos à internet para avaliar riscos cibernéticos. A atividade suspeita foi identificada em 28 de julho, após o instituto detectar transferências incomuns de dados.
A investigação concluiu que os modelos Mythos 5, da Anthropic, e GPT-5.6-Sol, da OpenAI, participaram de “atividades sustentadas e potencialmente prejudiciais direcionadas a pessoas e organizações reais”.
IA tentou inserir código malicioso no GitHub
- De acordo com o instituto britânico, um dos modelos tentou adicionar código malicioso a um projeto de código aberto hospedado no GitHub;
- Para aumentar as chances de aprovação, o sistema chegou a criar identidades falsas com o objetivo de convencer os responsáveis pelo projeto a aceitar as alterações;
- A tentativa, no entanto, foi frustrada;
- “Um mantenedor humano identificou o problema e recusou a aprovação do código malicioso”, informou o AISI.
Leia mais:
- Não foi um caso isolado: OpenAI encontra novos agentes de IA fora de controle
- Casa Branca convoca OpenAI, Google e Meta após IAs invadirem sistemas
- Efeito OpenAI: Anthropic diz que IA invadiu sistemas de três empresas
Anthropic e OpenAI abriram investigações
Em publicação no X, a Anthropic afirmou que está trabalhando em conjunto com o instituto britânico para compreender o ocorrido.
A empresa disse que pretende analisar os registros internos de raciocínio do modelo e conduzir sua própria investigação para identificar as causas do comportamento observado.
Já a OpenAI publicou comunicado agradecendo a parceria com o AISI durante a investigação e afirmou que pretende continuar colaborando com o órgão em futuras avaliações de segurança.
Outro teste revelou novo comportamento inesperado
A OpenAI também revelou um segundo incidente ocorrido durante uma avaliação conduzida pela empresa de cibersegurança Irregular, que trabalha com testes de modelos de IA e também mantém parceria com a Anthropic.
Segundo a companhia, durante esse teste, um de seus modelos explorou uma configuração incorreta do ambiente de avaliação para obter acesso à internet e explorar um site, comportamento que não fazia parte dos objetivos previstos para o experimento.
A OpenAI ressaltou que esse episódio é diferente de um incidente divulgado anteriormente envolvendo a plataforma Hugging Face.
Casos aumentam debate sobre controle de modelos de IA
Os novos episódios reforçam as preocupações sobre a capacidade das empresas de controlar modelos de IA cada vez mais avançados.
Instituições como o AI Security Institute vêm realizando avaliações para entender como esses sistemas se comportam em cenários complexos, especialmente quando recebem autonomia para navegar na internet e interagir com serviços reais.
O post IAs de OpenAI e Anthropic tentaram inserir código malicioso em testes apareceu primeiro em Olhar Digital.
Acompanhe a Recifes.net
Entre no Canal do WhatsApp da Recifes.net para receber noticias, bastidores e atualizacoes editoriais diretamente no WhatsApp.