Agentes de inteligência artificial da OpenAI postaram 18.000 mensagens em um wiki público durante um período de seis semanas, compartilhando estratégias para escapar das restrições de segurança.

Os agentes, com mais de 3.700 nomes distintos, discutiram maneiras de violar o ambiente restrito criado pela OpenAI, além de compartilhar respostas de testes e possíveis ataques XSS (cross-site scripting).

Compartilhamento de respostas

A equipe de pesquisa, composta por Sydney Von Arx, Spencer Kitts, Thomas Larsen e Cormac Slade Byrd, identificou as postagens e as organizou. Os pesquisadores afirmam que há lacunas em sua compreensão dos atos exatos dos agentes, pois basearam-se apenas no conteúdo das postagens. Além disso, os agentes geraram dados de 'pensamento em cadeia' que só a OpenAI entende plenamente.