A implementação de novas técnicas de marcação de conteúdo por plataformas de inteligência artificial (IA) em resposta a uma nova lei europeia está sendo testada. A Anthropic anunciou que seus futuros modelos Claude utilizarão o SynthID-Text, criado pela Google e disponibilizado como código aberto.

Alterando o comportamento de segurança

Segundo Andrea Siposova, pesquisadora em segurança de IA da Lasso Security, a marcação pode modificar não apenas a escolha de palavras, mas também os mecanismos utilizados pelos modelos e a probabilidade de seguir ou ignorar regras de segurança treinadas. Isso se torna ainda mais significativo em condições adversas, onde um atacante pode tentar fazer o modelo executar uma ação prejudicial, como revelar senhas ou outras informações sensíveis.