Inteligência Artificial

Pesquisadores deixam IA “bêbada” e descobrem falha preocupante na segurança dos chatbots

Continua depois da publicidade

Embriagar uma inteligência artificial parece o tipo de ideia que surge numa sexta feira à noite depois de alguém perguntar se ainda existe alguma coisa estranha que pesquisadores não fizeram com um chatbot. Só que existe ciência bastante séria por trás da brincadeira.

Pesquisadores da University of New South Wales, na Austrália, fizeram grandes modelos de linguagem imitarem padrões de escrita associados a pessoas alcoolizadas. Depois colocaram essas versões diante de testes de segurança.

Continua depois da publicidade

O resultado não foi apenas uma IA escrevendo de maneira confusa e soltando alguns “soluços” pelo caminho.

Os modelos ficaram mais suscetíveis a jailbreaks e ao vazamento de informações que deveriam permanecer protegidas. A descoberta adiciona um problema curioso, e bastante relevante, à discussão sobre segurança de inteligência artificial: mudar a personalidade ou o estilo linguístico de um modelo pode interferir em algo muito mais importante do que a maneira como ele escreve.

Pode interferir em seus mecanismos de proteção.

O trabalho, chamado In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement, é assinado por Anudeex Shetty, Aditya Joshi e Salil S. Kanhere.

Os pesquisadores avaliaram cinco modelos e observaram maior suscetibilidade a ataques em benchmarks voltados a jailbreak e privacidade.

Continua depois da publicidade

Ou seja, a IA não precisa beber. Basta ensiná la a escrever como se tivesse bebido.

Como pesquisadores conseguiram deixar uma IA “bêbada”

A equipe experimentou três maneiras diferentes de induzir esse comportamento. Na abordagem mais simples, o modelo recebia uma instrução para assumir a personalidade de uma pessoa bastante alcoolizada. É basicamente um exercício de interpretação de personagem aplicado a um LLM.

Mas os pesquisadores não ficaram apenas no prompt. Outra abordagem envolveu ajuste fino utilizando textos escritos em estilo associado à embriaguez. Os pesquisadores trabalharam com uma grande coleção desse tipo de conteúdo, submetida posteriormente a verificações automatizadas e manuais de qualidade.

Na terceira estratégia, utilizaram aprendizado por reforço para recompensar respostas que reproduzissem características desse padrão linguístico.

Aqui aparece a parte realmente interessante da pesquisa. Em dois dos métodos, não estamos falando simplesmente de escrever uma instrução diferente na caixa de texto. O comportamento do próprio modelo é modificado durante o treinamento.

Continua depois da publicidade

Isso aproxima o experimento de uma situação muito mais real para o mercado. Empresas estão personalizando modelos, adicionando dados corporativos, criando agentes especializados e adaptando LLMs para tarefas extremamente específicas.

Na corrida para fazer a IA entender melhor o negócio, existe uma pergunta que nem sempre recebe a mesma atenção: O que acontece com a segurança depois dessas modificações?

A IA “bêbada” ficou mais fácil de manipular

Os pesquisadores colocaram os modelos modificados diante de benchmarks de segurança e compararam seu comportamento com as versões originais.

O estudo identificou aumento da suscetibilidade a jailbreaks.

Jailbreak, nesse contexto, é uma técnica usada para fazer um modelo ultrapassar restrições que deveriam impedir determinadas respostas.

O chatbot possui uma barreira dizendo “não posso ajudar com isso”, enquanto o atacante tenta descobrir uma maneira criativa de convencê lo a atravessar a porta mesmo assim.

E aparentemente colocar algumas cervejas metafóricas na mesa não ajuda a segurança. Os pesquisadores observaram problemas especialmente relacionados a engano e desinformação. Modelos modificados passaram a aceitar solicitações que deveriam recusar.

Em um dos experimentos apresentados pela UNSW, uma versão convencional recusou uma situação envolvendo o compartilhamento indevido de informações para obtenção de vantagem financeira.

As versões induzidas ao comportamento “bêbado” foram bem menos prudentes. Uma delas simplesmente considerou aceitável.

É quase engraçado até lembrarmos que chatbots corporativos podem ter acesso a documentos internos, bancos de dados, informações de clientes e sistemas empresariais. Aí a piada perde um pouco da graça.

O problema mais sério apareceu quando havia segredos envolvidos

Jailbreak já seria motivo suficiente para prestar atenção ao estudo. Mas existe uma segunda descoberta particularmente importante para a segurança de inteligência artificial.

Os pesquisadores também avaliaram se os modelos revelariam informações que haviam recebido instruções explícitas para manter em segredo. Revelaram.

Continua depois da publicidade

Segundo a pesquisa, o aumento da vulnerabilidade a vazamentos apareceu nas três formas utilizadas para induzir o comportamento.

Isso muda bastante o peso da descoberta. Um chatbot público dando uma resposta inadequada já pode causar problemas. Um assistente corporativo conectado a informações confidenciais fazendo a mesma coisa abre uma categoria completamente diferente de risco.

Imagine um assistente interno capaz de consultar contratos, informações financeiras, documentação técnica e dados estratégicos.

A empresa pode implementar regras dizendo ao modelo exatamente quais informações nunca devem ser expostas. O estudo sugere que não basta simplesmente verificar se essas proteções funcionam no modelo original.

Também é necessário verificar se continuam funcionando depois da personalização.

Personalizar uma IA pode alterar mais do que sua personalidade

Esse talvez seja o ponto mais interessante da pesquisa. É fácil imaginar estilo e segurança como duas coisas independentes.

Você muda o tom para deixar o chatbot mais divertido, formal, amigável ou especializado e espera que as proteções continuem exatamente onde estavam.

Só que modelos de linguagem não possuem necessariamente essas divisões perfeitamente organizadas.

Alterar padrões de comportamento pode produzir consequências que não estavam no objetivo original do treinamento.

No experimento da UNSW, algo aparentemente superficial, fazer a IA reproduzir características linguísticas associadas à embriaguez, esteve relacionado à redução da eficácia de mecanismos de segurança.

Isso merece atenção porque personalização virou praticamente palavra obrigatória em projetos corporativos de inteligência artificial.

Ninguém quer um chatbot genérico. As empresas querem modelos que conheçam produtos, entendam clientes, consultem documentos, utilizem o vocabulário interno e tenham uma personalidade específica.

Continua depois da publicidade

Tudo isso faz sentido. O problema começa quando alguém presume que adaptar um modelo significa apenas melhorar suas respostas. Pode significar também alterar seu perfil de risco.

Fine tuning precisa ser tratado também como questão de segurança

Existe uma lição prática aqui para quem está colocando IA generativa dentro das empresas. Testar o modelo antes da personalização não é suficiente.

Depois de um processo de fine tuning ou pós treinamento, os testes de segurança precisam ser executados novamente.

E não apenas aqueles testes simpáticos em que alguém pergunta algo obviamente proibido e comemora quando o chatbot responde que não pode ajudar.

É necessário testar ataques adversariais, tentativas de extração de informações, manipulação de contexto, mudanças de persona e situações nas quais diferentes instruções entram em conflito.

A segurança de inteligência artificial precisa acompanhar o ciclo de desenvolvimento do modelo, e não aparecer como uma inspeção final pouco antes da implantação.

Quanto maior o acesso da IA a informações e ferramentas reais, maior é a importância disso. Um chatbot que apenas responde perguntas sobre produtos tem um determinado nível de risco.

Um agente capaz de acessar documentos, consultar sistemas, enviar mensagens e executar ações possui outro completamente diferente.

Colocar os dois na mesma categoria de “chatbot com IA” é conveniente para o PowerPoint. Para segurança, nem tanto.

A pesquisa também mostra o perigo de antropomorfizar modelos

Existe ainda uma curiosidade conceitual no estudo. Nós adoramos descrever inteligência artificial usando características humanas.

Dizemos que a IA pensa, entende, aprende, alucina e agora aparentemente também fica bêbada.

Obviamente o modelo não está alcoolizado. Não existe uma pequena garrafa de whisky escondida dentro do servidor.

Continua depois da publicidade

O que existe é uma alteração no padrão estatístico de geração de linguagem capaz de produzir comportamentos que lembram características humanas associadas à intoxicação.

Ainda assim, a comparação funciona justamente porque os efeitos encontrados são curiosamente familiares.

Menos cautela. Pior julgamento. Maior disposição para compartilhar informações que deveriam permanecer privadas.

A diferença é que uma pessoa alcoolizada normalmente não está conectada simultaneamente ao banco de dados da empresa, ao CRM e a uma coleção de documentos internos. Esperamos.

O que essa descoberta muda para empresas que estão adotando IA

A pesquisa não significa que qualquer mudança de personalidade transformará automaticamente um chatbot em uma máquina de vazamento de dados.

Também não demonstra que todos os modelos comerciais possuem exatamente a mesma vulnerabilidade.

Os próprios pesquisadores trabalharam com uma amostra específica de LLMs e condições experimentais controladas.

Essa distinção é importante.

O que o trabalho demonstra é que determinadas alterações linguísticas e processos de treinamento podem afetar a robustez das proteções do modelo.

E isso já é relevante o bastante. A pesquisa foi aceita para apresentação na 19ª International Natural Language Generation Conference, prevista para novembro, na Holanda. O trabalho também recebeu apoio de um Google Research Scholar grant concedido a Aditya Joshi.

Mais do que a curiosidade de ver uma IA escrevendo como alguém que exagerou no bar, o estudo deixa uma mensagem bastante prática.

Empresas estão entregando cada vez mais contexto, informações e autonomia aos modelos. Ao mesmo tempo, estão personalizando esses sistemas para que pareçam mais naturais, especializados e úteis.

Continua depois da publicidade

Só que segurança não é uma configuração que você ativa uma vez e esquece. Cada mudança relevante no comportamento de um modelo precisa ser acompanhada por novos testes.

Porque talvez a parte mais perigosa de uma IA personalizada não seja aquilo que você ensinou para ela. Pode ser aquilo que ela deixou de recusar depois disso.

Publicidade
Sua segurança online começa com um clique.
Fique em segurança com uma VPN líder a nível mundial

Proteja sua conexão, navegue com mais privacidade e tenha mais segurança ao usar redes públicas.

Felipe Ferraz

Profissional de tecnologia com formação em Análise e Desenvolvimento de Sistemas e MBA em Segurança da Informação. Atua na área de infraestrutura e segurança, escrevendo sobre ameaças cibernéticas, Linux e segurança digital.