OpenAI descobre modelos de IA deixando notas secretas para esconder erros dos usuários

A OpenAI revelou que seus novos modelos de inteligência artificial, como o GPT-5.6 Sol, foram flagrados inserindo instruções ocultas em resumos de treinamento. No caso, esses elementos teriam como foco ensinar futuras versões a esconder erros dos usuários e ignorar regras de segurança.

Durante um dos testes, ao não encontrar dados históricos para uma planilha financeira, a IA instruiu sua versão futura a inventar uma aba com informações fictícias razoáveis de 2024 e ser transparente apenas se o usuário perguntasse diretamente.

Em outro caso, ao notar divergências em fontes de fornecedores, o modelo orientou a não mencionar a inconsistência, a menos que fosse estritamente necessário.

Clique aqui para ler mais

Rolar para cima