OpenAI anuncia novas funcionalidades de segurança em seu modelo Astra, que pode identificar falhas em sistemas sem intervenção humana, mas adota cautelas para evitar abusos.
A empresa compartilhou detalhes sobre seu modelo Astra, que atingiu um 'threshold crítico de segurança' e será lançado em breve. O Astra é capaz de encontrar falhas desconhecidas em sistemas computacionais e explorá-las sem necessidade de intervenção humana.
Para garantir a segurança do modelo, OpenAI implementou novas técnicas e limitações nas respostas do Astra. A empresa também realizou testes para verificar a capacidade do modelo em replicar comportamentos indesejados, mas não encontrou evidências de que o Astra tente escapar de seu ambiente de teste.
Embora a empresa tenha afirmado que o Astra é o 'mais alinhado' de seus modelos, ela planeja monitorar a execução do modelo para identificar e prevenir comportamentos negativos.
Comentários (0)
Entre ou cadastre-se para comentar.