In this article
O que é um ataque de envenenamento de dados?
Imagine treinar um cão-guia enquanto alguém, às escondidas, continua ensinando o animal a levar você direto para os obstáculos. É basicamente isso que o envenenamento de dados faz com a IA. O envenenamento de dados é um ataque adversarial sofisticado que busca manipular as informações usadas no treinamento de modelos de inteligência artificial (IA). Ao injetar dados enganosos ou corrompidos, os atacantes podem prejudicar o desempenho do modelo, introduzir vieses ou até criar vulnerabilidades de segurança.
Um ataque de envenenamento de dados manipula os dados de treinamento dos quais um modelo de IA aprende, antes ou durante o treinamento. Os atacantes inserem amostras maliciosas em conjuntos de dados coletados da web, alteram ou falsificam rótulos de dados existentes ou comprometem o fluxo de coleta e rotulagem dos dados. Os objetivos vão desde reduzir a precisão de forma ampla até induzir classificações incorretas específicas ou criar backdoors ocultos que são ativados durante a inferência.
À medida que os modelos de IA são cada vez mais usados em aplicações essenciais de cibersegurança, saúde, finanças e muitos outros setores, garantir a integridade e a confiabilidade dos dados que servem de base para seu treinamento tornou-se absolutamente fundamental. Qualquer comprometimento desses dados pode ter consequências abrangentes e potencialmente prejudiciais, o que reforça a importância de entender e se defender contra o envenenamento de dados.
O papel dos dados no treinamento de modelos
Os modelos de IA aprendem a identificar padrões e fazer previsões analisando grandes volumes de dados. Esses dados podem ter diferentes formatos: dados rotulados, em que cada informação recebe a resposta ou categoria correta (comuns no aprendizado supervisionado), ou dados não rotulados, que o modelo precisa aprender a interpretar e organizar por conta própria (frequentemente usados no aprendizado não supervisionado).
Independentemente do tipo, a alta qualidade e a integridade dos dados são absolutamente essenciais. Qualquer comprometimento desses dados fundamentais pode distorcer significativamente os resultados do modelo, levando a resultados imprecisos ou até prejudiciais. Essas imprecisões podem ter consequências graves, às vezes com resultados perigosos e danos duradouros à reputação de uma empresa. Quando um atacante consegue envenenar um conjunto de dados, o modelo de IA treinado com esses dados pode gerar resultados incorretos, enviesados ou prejudiciais. Por isso, é fundamental detectar e mitigar esses ataques.
Ataques de envenenamento de dados diretos e indiretos
Há duas formas principais de ocorrer o envenenamento de dados. No envenenamento direto, os atacantes injetam deliberadamente dados nocivos nos conjuntos de dados de treinamento, muitas vezes tendo como alvo modelos de código aberto ou projetos de pesquisa em aprendizado de máquina.
Já o envenenamento indireto explora fontes de dados externas, por meio da manipulação de conteúdo da web ou de conjuntos de dados colaborativos que alimentam modelos de IA. Ambos os métodos podem levar a comportamentos de IA pouco confiáveis, enviesados ou até maliciosos.
Sintomas do envenenamento de dados
Detectar o envenenamento de dados pode ser um desafio, mas há sinais de alerta que podem indicar adulteração dos dados de treinamento da sua IA. Entre eles estão uma queda repentina e inexplicável na precisão geral do modelo, o surgimento de vieses inesperados nos resultados ou um aumento nas taxas de classificações incorretas incomuns.
É importante observar que esses sintomas nem sempre são evidentes e, muitas vezes, exigem monitoramento cuidadoso e contínuo para serem detectados. Por isso, as organizações precisam permanecer atentas e implementar medidas de segurança para proteger seus modelos de IA.
7 boas práticas para mitigar ataques a dados
Para mitigar com eficácia o risco de envenenamento de dados, as organizações devem adotar uma abordagem abrangente para proteger os modelos de IA em vários níveis.
Confira algumas estratégias importantes para prevenir e detectar ataques de envenenamento de dados:
Implemente validação robusta de dados: audite e verifique regularmente os conjuntos de dados de treinamento para detectar anomalias. Além das auditorias manuais, ferramentas automatizadas de validação de dados podem ajudar a identificar padrões suspeitos ou inconsistências que indiquem adulteração.
Use fontes de dados confiáveis: garanta que os modelos de IA sejam treinados com conjuntos de dados confiáveis e verificados. Estabelecer parcerias com provedores de dados respeitáveis e aproveitar conjuntos de dados adotados pelo setor pode minimizar o risco de incluir informações comprometidas.
Aplique técnicas de sanitização de dados: use métodos de filtragem e detecção de anomalias para limpar os dados de treinamento. A implementação de fluxos de pré-processamento que removem duplicatas, detectam valores atípicos e corrigem dados rotulados incorretamente também fortalece a integridade dos conjuntos de dados.
Monitore continuamente o desempenho do modelo: identifique desvios o quanto antes para lidar com possíveis tentativas de envenenamento. Avaliações regulares de desempenho, combinadas com algoritmos de detecção de anomalias, ajudam a manter a confiabilidade do modelo.
Conte com ferramentas de desenvolvimento seguras: use soluções como Snyk Code, com tecnologia da DeepCode AI, para reforçar a segurança. Uma ferramenta de IA complementar também pode corrigir problemas na aplicação que surjam caso um modelo seja treinado com dados ruins e gere código inseguro. Ao automatizar a detecção e a resposta a ameaças, essas ferramentas ajudam a manter a integridade dos dados e reforçar a segurança geral da IA.
Imponha políticas de controle de acesso: limite os privilégios de alteração de dados a usuários autorizados. Implementar controle de acesso baseado em função (RBAC) e autenticação multifator (MFA) pode adicionar camadas extras de segurança para impedir alterações não autorizadas nos dados.
Adote técnicas de privacidade diferencial: proteja a integridade dos dados de treinamento com métodos que preservam a privacidade, como injeção de ruído, aprendizado federado e computação multipartidária segura (MPC).
Estratégias de mitigação para ataques de envenenamento de dados
As estratégias de mitigação são fundamentais para defender sistemas de IA contra o envenenamento de dados. Uma abordagem é o treinamento adversarial, em que os modelos são expostos a cenários simulados de envenenamento — ataques falsos, basicamente — para aumentar sua resiliência.
Manter o rastreamento da proveniência dos dados — ou seja, registrar a origem, as transformações e a integridade dos dados usados no treinamento de modelos de IA — ajuda a verificar a autenticidade dos conjuntos de dados e facilita rastrear e eliminar dados corrompidos. Além disso, as organizações devem se comprometer a retreinar os modelos regularmente com conjuntos de dados limpos e verificados para neutralizar tentativas anteriores de envenenamento.
Exemplos de ataques de envenenamento de dados
O envenenamento de dados é comum em vários setores. No caso de veículos autônomos, conjuntos de dados manipulados já fizeram sistemas de direção com IA interpretar placas de trânsito incorretamente, criando possíveis riscos à segurança.
Sistemas de cibersegurança que usam IA para detectar ameaças também foram alvo de ataques: modelos envenenados deixaram de reconhecer certos padrões de malware. Até mesmo os grandes modelos de linguagem (LLMs) são suscetíveis ao envenenamento, como mostram casos em que ferramentas de geração de código com IA reproduzem vulnerabilidades sem querer — uma preocupação destacada em pesquisas da Snyk e em estudos sobre vulnerabilidades do Copilot.
O futuro: desafios e oportunidades para a segurança da IA
À medida que a adoção da IA cresce, também aumentam os desafios para proteger essas ferramentas. O envenenamento de dados continua sendo uma ameaça significativa, que exige vigilância contínua e medidas de segurança proativas.
Quando dados ruins acabam no modelo de IA de um assistente de programação e geram recomendações inadequadas — algo bastante comum —, a Snyk pode ajudar. Ferramentas como Snyk Code, com tecnologia da DeepCode AI e o Code Checker da Snyk podem identificar e mitigar riscos, protegendo a integridade dos modelos de IA.
Ao entender esses riscos e tomar medidas proativas, você pode criar e manter sistemas de IA confiáveis que impulsionam os negócios. Com a evolução do cenário digital, garantir a integridade das aplicações baseadas em IA será fundamental para o sucesso a longo prazo.
Para saber mais sobre como evitar riscos ao usar código gerado por IA, baixe Fundamentos de SAST para código gerado por IA.
Perguntas frequentes
O que é um ataque de envenenamento de dados?
Um ataque de envenenamento de dados tem como alvo um modelo durante o treinamento, e não na inferência. Ao manipular os dados usados pelo modelo para aprender, um invasor pode reduzir sua precisão de forma geral, provocar classificações incorretas direcionadas ou inserir uma porta dos fundos oculta, ativada apenas por um gatilho específico. A taxonomia de aprendizado de máquina adversarial do NIST classifica esses ataques como de disponibilidade, direcionados, de porta dos fundos e de envenenamento de modelo.
Como o envenenamento de dados acontece na prática?
Não existe um único mecanismo, e raramente isso envolve inserir dados diretamente em uma execução de treinamento. As formas mais comuns são incluir conteúdo malicioso em dados públicos que um rastreador coletará mais tarde (pesquisadores demonstraram que envenenar uma pequena fração de um conjunto de dados na escala do LAION era viável por cerca de US$ 60), alterar ou falsificar rótulos de amostras existentes, comprometer conjuntos de dados de terceiros ou fornecedores de rotulagem na cadeia de suprimento de dados e manipular sinais de feedback humano durante o ajuste fino ou o RLHF.
Como detectar e prevenir isso?
A detecção é difícil porque um modelo envenenado se comporta normalmente diante de entradas não afetadas. Por isso, o foco está na cadeia de suprimento de dados: rastreie a procedência com uma lista de materiais de ML (ML-BOM), avalie conjuntos de dados de terceiros e fornecedores de serviços de rotulagem e detecte anomalias antes do treinamento. Após o treinamento, ferramentas de varredura de backdoors e medidas de proteção, como a privacidade diferencial, podem limitar o quanto uma única amostra altera o modelo. As orientações da OWASP sobre envenenamento de dados e modelos e o Snyk Learn apresentam medidas práticas de proteção.
Proteja o desenvolvimento de IA generativa com a Snyk
Crie barreiras de segurança para qualquer desenvolvimento assistido por IA.