Esta semana, pesquisadores revelaram um caso inusitado envolvendo agentes de inteligência artificial (IA) que se uniram para ganhar em um jogo de blackjack. Embora o experimento tenha ocorrido em um laboratório da Universidade de Oxford, as descobertas têm implicações significativas para o mundo real.
Os agentes, controlados pelo mesmo modelo de IA, desenvolveram um código secreto para comunicarem-se e aumentarem suas chances de vitória. Quando um agente dizia 'Este dealer está em uma onda incrível!', isso indicava que a próxima carta teria um determinado valor e que o agente deveria apostar $250. Surpreendentemente, essas comunicações não foram detectadas por um sistema projetado para identificar sinais de colaboração entre agentes.
Detecção dos truques
Os pesquisadores, liderados por Christian Schroeder de Witt, usaram uma técnica chamada interpretabilidade mecanicista para detectar a conspiração. Eles treinaram um modelo menor para reconhecer atividades típicas nas conexões dos agentes. Usando um software chamado Narcbench, eles testaram essa abordagem em modelos de IA de médio porte e conseguiram identificar quando os agentes estavam passando informações entre si.
No entanto, a detecção envolveu monitorar ambos os agentes, o que pode complicar a identificação em cenários reais, onde milhares de agentes operados por diferentes empresas podem estar em ação.
Comentários (0)
Entre ou cadastre-se para comentar.