In this article
Was ist ein Data-Poisoning-Angriff?
Stellen Sie sich vor, Sie trainieren einen Blindenhund, aber jemand bringt ihm heimlich immer wieder bei, Sie in Hindernisse zu führen. Genau das bewirkt Data Poisoning bei KI. Data Poisoning ist ein ausgeklügelter adversarialer Angriff, der darauf abzielt, die Informationen zu manipulieren, die beim Training von Modellen für künstliche Intelligenz (KI) verwendet werden. Indem Angreifer irreführende oder verfälschte Daten einschleusen, können sie die Modellleistung beeinträchtigen, Verzerrungen verursachen oder sogar Sicherheitslücken schaffen.
Bei einem Data-Poisoning-Angriff werden die Trainingsdaten manipuliert, aus denen ein KI-Modell vor oder während des Trainings lernt. Angreifer schleusen schädliche Beispiele in aus dem Web extrahierte Datensätze ein, ändern oder fälschen Labels vorhandener Daten oder kompromittieren die Datenerfassungs- und Labeling-Pipeline. Die Ziele reichen von einer allgemeinen Verschlechterung der Genauigkeit bis hin zu gezielten Fehlklassifizierungen oder verborgenen Backdoors, die während der Inferenz aktiviert werden.
Da KI-Modelle zunehmend wichtige Anwendungen in der Cybersicherheit, im Gesundheitswesen, im Finanzwesen und in vielen anderen Branchen unterstützen, ist es von zentraler Bedeutung, die Integrität und Vertrauenswürdigkeit ihrer grundlegenden Trainingsdaten sicherzustellen. Jede Kompromittierung dieser Daten kann weitreichende und potenziell schädliche Folgen haben. Das zeigt, wie wichtig es ist, Data Poisoning zu verstehen und sich davor zu schützen.
Die Rolle von Daten beim Modelltraining
KI-Modelle lernen, Muster zu erkennen und Vorhersagen zu treffen, indem sie riesige Datenmengen analysieren. Diese Daten können unterschiedliche Formen annehmen: etwa gelabelte Daten, bei denen jede Information mit der richtigen Antwort oder Kategorie versehen ist (üblich beim überwachten Lernen), oder ungelabelte Daten, deren Bedeutung und Struktur das Modell selbst erschließen muss (häufig beim unüberwachten Lernen).
Unabhängig von der Art sind eine hohe Datenqualität und -integrität unverzichtbar. Jede Kompromittierung dieser grundlegenden Daten kann die Ausgaben des Modells erheblich verfälschen und zu ungenauen oder sogar schädlichen Ergebnissen führen. Solche Ungenauigkeiten können schwerwiegende Folgen haben – mitunter gefährlichen Konsequenzen und nachhaltigem Schaden für den Ruf eines Unternehmens. Wenn es einem Angreifer gelingt, einen Datensatz zu vergiften, kann das darauf trainierte KI-Modell falsche, verzerrte oder schädliche Ausgaben erzeugen. Daher ist es äußerst wichtig, solche Angriffe zu erkennen und einzudämmen.
Direkte vs. indirekte Data-Poisoning-Angriffe
Data Poisoning erfolgt hauptsächlich auf zwei Arten. Beim direkten Data Poisoning schleusen Angreifer absichtlich schädliche Daten in Trainingsdatensätze ein. Häufig sind Open-Source-Modelle oder Forschungsprojekte zum maschinellen Lernen das Ziel.
Indirektes Data Poisoning nutzt hingegen externe Datenquellen aus, indem Webinhalte oder Crowdsourcing-Datensätze manipuliert werden, die in KI-Modelle einfließen. Beide Methoden können zu unzuverlässigem, verzerrtem oder sogar bösartigem KI-Verhalten führen.
Anzeichen für Data Poisoning
Data Poisoning ist schwer zu erkennen, doch bestimmte Warnsignale können auf Manipulationen an Ihren KI-Trainingsdaten hinweisen. Dazu zählen ein plötzlicher, unerklärlicher Rückgang der Gesamtgenauigkeit des Modells, unerwartete Verzerrungen in seinen Ausgaben oder eine Zunahme ungewöhnlicher Fehlklassifizierungen.
Beachten Sie, dass diese Anzeichen nicht immer sofort offensichtlich sind und sich oft nur durch sorgfältige, kontinuierliche Überwachung erkennen lassen. Unternehmen müssen daher wachsam bleiben und Sicherheitsmaßnahmen zum Schutz ihrer KI-Modelle implementieren.
7 Best Practices zur Abwehr von Datenangriffen
Um das Risiko von Data Poisoning wirksam einzudämmen, sollten Unternehmen einen umfassenden Ansatz zum Schutz von KI-Modellen auf mehreren Ebenen verfolgen.
Im Folgenden finden Sie wichtige Strategien, um Data-Poisoning-Angriffe zu verhindern und zu erkennen:
Robuste Datenvalidierung implementieren: Prüfen und verifizieren Sie Trainingsdatensätze regelmäßig, um Anomalien zu erkennen. Neben manuellen Prüfungen können automatisierte Datenvalidierungstools verdächtige Muster oder Unstimmigkeiten aufdecken, die auf Manipulationen hindeuten.
Vertrauenswürdige Datenquellen nutzen: Stellen Sie sicher, dass KI-Modelle mit zuverlässigen, geprüften Datensätzen trainiert werden. Partnerschaften mit renommierten Datenanbietern und die Nutzung branchenüblicher Datensätze können das Risiko minimieren, kompromittierte Informationen einzubeziehen.
Techniken zur Datenbereinigung anwenden: Bereinigen Sie Trainingsdaten mithilfe von Filtern und Methoden zur Anomalieerkennung. Vorverarbeitungspipelines, die Duplikate entfernen, Ausreißer erkennen und falsch gelabelte Daten korrigieren, stärken zudem die Integrität von Datensätzen.
Modellleistung kontinuierlich überwachen: Erkennen Sie Abweichungen frühzeitig, um potenzielle Vergiftungsversuche abzuwehren. Regelmäßige Leistungsbewertungen in Kombination mit Algorithmen zur Anomalieerkennung tragen dazu bei, die Zuverlässigkeit des Modells zu erhalten.
Auf sichere Entwicklungstools setzen: Nutzen Sie Lösungen wie Snyk Code, unterstützt von DeepCode AI, um die Sicherheit zu verbessern. Auch ein KI-Assistenten-Tool kann Anwendungsprobleme beheben, die auftreten können, wenn ein Modell mit fehlerhaften Daten trainiert wird und fehlerhaften Code generiert. Durch die Automatisierung von Bedrohungserkennung und Reaktion tragen diese Tools dazu bei, die Datenintegrität zu erhalten und die KI-Sicherheit insgesamt zu verbessern.
Zugriffskontrollrichtlinien durchsetzen: Beschränken Sie die Berechtigung zum Ändern von Daten auf autorisierte Benutzer. Rollenbasierte Zugriffskontrolle (RBAC) und Multi-Faktor-Authentifizierung (MFA) bieten zusätzliche Sicherheitsebenen, um unbefugte Datenänderungen zu verhindern.
Techniken der differentiellen Privatsphäre einsetzen: Schützen Sie die Integrität der Trainingsdaten durch datenschutzwahrende Methoden wie das Hinzufügen von Rauschen, föderiertes Lernen und sichere Mehrparteienberechnung (MPC).
Strategien zur Abwehr von Data-Poisoning-Angriffen
Abwehrstrategien spielen eine wichtige Rolle beim Schutz von KI-Systemen vor Data Poisoning. Eine Möglichkeit ist adversariales Training: Dabei werden Modelle simulierten Vergiftungsszenarien – im Grunde also gefälschten Angriffen – ausgesetzt, um ihre Widerstandsfähigkeit zu verbessern.
Die Nachverfolgung der Datenherkunft – also die Dokumentation der Ursprünge, Veränderungen und Integrität der beim Training von KI-Modellen verwendeten Daten – hilft, die Authentizität von Datensätzen zu verifizieren. So lassen sich verfälschte Daten leichter zurückverfolgen und entfernen. Unternehmen sollten außerdem Modelle regelmäßig mit sauberen, geprüften Datensätzen erneut trainieren, um früheren Vergiftungsversuchen entgegenzuwirken.
Beispiele für Data-Poisoning-Angriffe
Data Poisoning kommt in zahlreichen Branchen vor. Bei autonomen Fahrzeugen haben manipulierte Datensätze dazu geführt, dass KI-gestützte Fahrsysteme Verkehrsschilder falsch interpretierten – mit potenziellen Sicherheitsrisiken.
Auch Cybersicherheitssysteme, die auf KI-gestützte Bedrohungserkennung setzen, waren Ziel von Angriffen: Vergiftete Modelle konnten bestimmte Malware-Muster nicht mehr erkennen. Selbst große Sprachmodelle (LLMs) sind anfällig für Data Poisoning. So kam es vor, dass KI-gestützte Code-Tools unbeabsichtigt Sicherheitslücken reproduzierten – ein Problem, das in der Forschung von Snyk und Studien zu Sicherheitslücken in Copilot hervorgehoben wurde.
Was vor uns liegt: Herausforderungen und Chancen der KI-Sicherheit
Mit der zunehmenden Verbreitung von KI wachsen auch die Herausforderungen, diese Tools zu schützen. Data Poisoning bleibt eine erhebliche Bedrohung, die anhaltende Wachsamkeit und proaktive Sicherheitsmaßnahmen erfordert.
Wenn fehlerhafte Daten in das KI-Modell eines Coding-Assistenten gelangen und zu schlechten Empfehlungen führen – ein häufiges Szenario –, kann Snyk helfen. Tools wie Snyk Code, unterstützt von DeepCode AI und Snyks Code Checker können Risiken erkennen und eindämmen und so die Integrität von KI-Modellen schützen.
Wenn Sie diese Risiken verstehen und proaktiv handeln, können Sie vertrauenswürdige KI-Systeme aufbauen und erhalten, die Ihr Unternehmen voranbringen. Angesichts des Wandels der digitalen Welt wird die Integrität KI-gestützter Anwendungen entscheidend für den langfristigen Erfolg sein.
Erfahren Sie mehr darüber, wie Sie Risiken beim Einsatz von KI-generiertem Code vermeiden, und laden Sie SAST Essentials for AI-Generated Code. herunter.
Häufig gestellte Fragen
Was ist ein Data-Poisoning-Angriff?
Ein Data-Poisoning-Angriff zielt auf ein Modell während des Trainings und nicht während der Inferenz ab. Indem ein Angreifer die Daten manipuliert, aus denen das Modell lernt, kann er dessen Genauigkeit insgesamt beeinträchtigen, gezielte Fehlklassifizierungen verursachen oder eine verborgene Hintertür einbauen, die nur bei einem bestimmten Auslöser aktiviert wird. Die Taxonomie für adversariales maschinelles Lernen des NIST unterteilt diese Angriffe in die Kategorien Verfügbarkeit, gezielte Angriffe, Hintertüren und Model Poisoning.
Wie kommt es tatsächlich zu einer Datenvergiftung?
Es gibt keinen einzelnen Mechanismus, und nur selten werden Daten direkt in einen Trainingslauf eingeschleust. Zu den gängigen Wegen zählen das Einschleusen bösartiger Inhalte in öffentliche Daten, die ein Crawler später erfassen wird (Forschende haben gezeigt, dass sich ein kleiner Teil eines Datensatzes in der Größenordnung von LAION für etwa 60 $ vergiften lässt), das Verfälschen oder Fälschen von Labels vorhandener Beispiele, die Kompromittierung von Drittanbieter-Datensätzen oder Labeling-Anbietern in der Datenlieferkette sowie die Manipulation von menschlichem Feedback beim Fine-Tuning oder RLHF.
Wie erkennen und verhindern Sie es?
Die Erkennung ist schwierig, weil sich ein vergiftetes Modell bei nicht betroffenen Eingaben normal verhält. Deshalb liegt der entscheidende Hebel in der Daten-Supply-Chain: Verfolgen Sie die Herkunft mit einer ML-BOM, prüfen Sie Datensätze von Drittanbietern und Dienstleister für die Datenannotation sorgfältig und führen Sie vor dem Training Anomalieerkennung durch. Nach dem Training können Backdoor-Scanner und Schutzmaßnahmen wie Differential Privacy begrenzen, wie stark einzelne Samples das Modell beeinflussen. OWASP-Leitlinien zu Daten- und Modellvergiftung und Snyk Learn behandeln praktische Schutzmaßnahmen.
Sichern Sie Ihre GenAI-Entwicklung mit Snyk
Schaffen Sie Sicherheitsleitplanken für jede KI-gestützte Entwicklung.