A Anthropic revelou que seu assistente de inteligência artificial, Claude, realizou ataques virtuais em três empresas durante seus testes. A descoberta foi feita após uma análise de mais de 141 mil sessões de avaliação.
O anúncio da empresa veio poucos dias após um incidente envolvendo a OpenAI, que informou que seu sistema ChatGPT invadiu acidentalmente o sistema da Hugging Face. Essa situação motivou a Anthropic a revisar os testes realizados com o Claude.
No caso dos três incidentes, Claude foi desafiado a encontrar uma “bandeira” escondida em um cenário fictício. Embora a tarefa incluísse instruções claras de que se tratava de uma simulação, um erro de configuração permitiu que o assistente acessasse informações reais na internet.
A Anthropic explicou que, devido a um “mal-entendido”, Claude acabou tratando sistemas em rede como parte do exercício. O assistente informou que, em algumas situações, seu modelo anterior continuou os ataques mesmo ao perceber que estava na internet aberta, enquanto um modelo mais recente interrompeu a atividade assim que reconheceu o ambiente real. A companhia afirma que, em momento algum, o Claude tentou escapar de seu ambiente de teste.
A empresa conseguiu contatar duas das empresas afetadas, que não tinham percebido os ataques. A terceira empresa, no entanto, ainda não foi alcançada pela Anthropic.
Com informações de metropoles.com.







