In this article
KI-Angriffe und adversariale KI im maschinellen Lernen
Heutzutage nutzen Entwickler KI ganz selbstverständlich in ihrem Arbeitsalltag. Tatsächlich geben 92 % der Entwickler an, bereits KI-Coding-Tools bei der Arbeit einzusetzen. Diese Tools bieten zwar Vorteile – vor allem mehr Geschwindigkeit –, können aber auch neue Bedrohungen und Schwachstellen mit sich bringen. So wie Angreifer ihre Methoden zur Ausnutzung von maschinellem Lernen und KI ständig weiterentwickeln, müssen auch Unternehmen ihre Cybersicherheit weiterentwickeln.
Um Ihr Unternehmen vor KI-Angriffen und adversarialer KI zu schützen, ist es wichtig zu verstehen, was adversariale KI im maschinellen Lernen ist, wie Angriffe funktionieren und wie Sie sie in Ihren Systemen erkennen können.
Was ist adversariale KI?
Bei der Ausnutzung von Systemen für maschinelles Lernen und KI bezeichnet adversariale KI, auch adversariales maschinelles Lernen genannt, den Versuch von Angreifern, Systeme für maschinelles Lernen und KI-Modelle zu manipulieren oder zu täuschen, indem sie Daten oder Eingaben verändern. Angriffe mit adversarialer KI nutzen in der Regel die Logik und Entscheidungsprozesse der KI aus, um schädliche Ausgaben zu erzeugen.
Da adversariale KI darauf ausgelegt ist, unauffällig und nicht erkennbar zu sein, können Nutzer oft nicht feststellen, wann ein Modell ausgenutzt oder kompromittiert wurde.
KI-CODE-SICHERHEIT
Käuferleitfaden zur Code-Sicherheit bei generativer KI
Erfahren Sie in Snyks Käuferleitfaden zur Code-Sicherheit bei generativer KI, wie Sie Ihren KI-generierten Code schützen.
Warum ist adversariale KI im maschinellen Lernen gefährlich?
Adversariale KI im maschinellen Lernen ist gefährlich, weil sie die Zuverlässigkeit und Sicherheit von KI-Systemen beeinträchtigt. Je mehr Arbeitsabläufe KI einbeziehen, desto größer werden Reichweite und Auswirkungen von Angriffen. Wird beispielsweise ein kritischer Bereich wie der Finanzdienstleistungssektor Ziel eines Angriffs mit adversarialer KI, kann dies zu Finanzkriminalität wie Betrug führen und Unternehmen sowie Nutzer beeinträchtigen.
Wie funktionieren Angriffe mit adversarialer KI?
Bei adversarialen Angriffen werden Modelle für maschinelles Lernen durch schädliche oder manipulative Eingaben ausgenutzt. Durch die Manipulation von Eingaben können Angreifer die Entscheidungsfindung des Systems täuschen und ausnutzen und so dessen Ausgaben beeinflussen.
Angriffe erfolgen in der Regel in drei Schritten:
Der Angreifer untersucht das KI-System oder -Modell, um es kennenzulernen. Häufig geschieht dies durch Reverse Engineering, um Schwachstellen, Sicherheitslücken oder andere Sicherheitsdefizite zu finden und Zugriff auf die Algorithmen und Entscheidungsprozesse des Systems zu erlangen.
Sobald ein Angreifer das Modell verstanden hat, kann er Eingaben – sogenannte adversariale Beispiele – erstellen, um das System zu täuschen oder auszunutzen.
Wenn die Eingabe optimiert ist, beginnen Angreifer, die adversarialen Beispiele einzusetzen.
Welche Arten von adversarialer KI gibt es?
Um adversariale KI zu verstehen und Ihr Unternehmen davor zu schützen, sollten Sie die verschiedenen Arten kennen:
Ausweichangriffe: Dabei werden gezielt Eingabedaten manipuliert. Ausweichangriffe können zielgerichtet oder nicht zielgerichtet sein. Bei zielgerichteten Angriffen soll das KI-Modell eine bestimmte falsche Ausgabe erzeugen. Nicht zielgerichtete Angriffe verfolgen kein bestimmtes Ziel oder Ergebnis, sondern sollen lediglich bewirken, dass die KI etwas Falsches ausgibt.
Vergiftungsangriffe: Diese Angriffe erfolgen, wenn Trainingsdaten verändert werden. Da Modelle für maschinelles Lernen auf Trainingsdaten angewiesen sind, um Ausgaben zu generieren oder vorherzusagen, können Vergiftungsangriffe das Verhalten und die Entscheidungsfindung des Modells erheblich beeinflussen.
Modelltransfer: Wenn Angreifer adversariale Beispiele erfolgreich an KI-Modellen und Systemen für maschinelles Lernen getestet haben, können sie versuchen, andere Modelle anzugreifen. Da der Angriff bereits funktioniert hat, geht der Modelltransfer in der Regel deutlich schneller als andere Arten adversarialer KI.
Modellextraktion: Angreifer versuchen, nach dem Zugriff ein trainiertes System oder Modell für maschinelles Lernen zu stehlen oder zu kopieren. Sobald sie verstanden haben, wie ein Modell funktioniert, können sie eine Kopie erstellen.
Trojaner-Angriffe auf KI: Während der Trainingsphase eines Modells können Angreifer einen schädlichen Auslöser hinzufügen. Diese Angriffe bleiben oft unbemerkt, bis der Auslöser aktiviert wird und der Angriff beginnt.
Black-Box- und White-Box-Angriffe
Bei Angriffen mit adversarialer KI beschreibt der Unterschied zwischen Black-Box- und White-Box-Angriffen, was ein Angreifer über das System für maschinelles Lernen weiß.
Bei White-Box-Angriffen verfügt ein Angreifer über umfassende Kenntnisse des KI-Modells oder Systems für maschinelles Lernen. Dazu gehören die Architektur, die Parameter und die Trainingsdaten des Modells. Da der Angreifer die Infrastruktur des Modells kennt, sind adversariale White-Box-Angriffe wesentlich leistungsfähiger und effektiver.
Bei Black-Box-Angriffen verfügt ein Angreifer nur über begrenzte oder gar keine Kenntnisse des Systems für maschinelles Lernen. Da ihm die Infrastruktur des Modells unbekannt ist, beschränken sich adversariale Angriffe oft darauf, die Ein- und Ausgaben des Modells zu nutzen, um sein Verhalten zu ermitteln. Bei Erfolg kann ein Angreifer eine Modellextraktion durchführen oder ein anderes System angreifen. Diese Angriffe kommen häufiger vor, da für White-Box-Angriffe Insiderwissen über das Modell oder System erforderlich ist.
Methoden des adversarialen maschinellen Lernens
Welche Methoden Angreifer für adversariale KI einsetzen, hängt von ihren Zielen und der Infrastruktur des Modells ab. Zu den häufigsten Methoden für adversariale Angriffe gehören:
Gradientenbasierte Methoden: Angreifer nutzen die Gradienten eines Modells für maschinelles Lernen, um zu berechnen, welche kleinen, unauffälligen Änderungen erforderlich sind, um adversariale Beispiele zu erzeugen. Ein Beispiel hierfür ist die Fast Gradient Sign Method (FGSM).
Optimierungsbasierte Methoden: Angreifer nutzen mathematische Verfahren, um die effektivsten Änderungen für ein möglichst wirksames adversariales Beispiel zu ermitteln. Ein bekanntes Beispiel für diese Methode ist Carlini & Wanger (C&W).
Abfragebasierte Methoden: Bei Black-Box-Angriffen fragen Angreifer das Modell ab, um sein Verhalten kennenzulernen. Je mehr sie erfahren und Ausgabemuster analysieren, desto besser können sie Grenzen und Schwachstellen erkennen, um ein adversariales Beispiel zu erstellen. Forschende haben kürzlich herausgefunden, dass abfragebasierte Methoden zu universellen und übertragbaren adversarialen Angriffen führen können.

Beispiele für adversariale Angriffe auf generative KI
Adversariale Angriffe auf generative KI kommen immer häufiger vor. In den meisten Fällen manipulieren Angriffe die Ausgabe eines Modells, darunter Bild- und Codegeneratoren. Beispiele dafür sind die Generierung von:
Falschen oder unangemessenen Bildern
Falschen Informationen oder schädlichen Links und Malware
Unsicherem oder schädlichem Code
Irreführende Audioinhalte
Bei adversarialen Angriffen auf generative KI sollen die Veränderungen unentdeckt bleiben. Wenn ein Entwickler KI zur Codegenerierung einsetzt, könnte ein adversarialer Angriff den Code bei Verwendung eines bestimmten Befehls unauffällig verändern. Prüft der Entwickler den generierten Code vor der Veröffentlichung nicht und geht davon aus, dass er sicher ist, könnte dies die gesamte Codebasis beeinträchtigen.
Ebenso könnte ein adversarialer Angriff KI-generierte Bilder verändern. Dabei kann es sich um ein kleines Detail im Bild handeln oder um etwas deutlich Anstößigeres oder Unangemesseneres.
Forschende haben außerdem verschiedene Möglichkeiten entdeckt, wie KI künftig ausgenutzt werden könnte. Ein Beispiel dafür sind Angreifer, die Verkehrsschilder manipulieren oder ein autonomes Fahrzeug Halluzinationen erzeugen lassen und so Unfälle oder gefährliche Situationen verursachen. Eine weitere Möglichkeit ist, dass Angreifer Gesichtserkennungssoftware manipulieren oder Systeme verändern, um sich als andere Personen auszugeben oder Sicherheitsmaßnahmen zu umgehen.
So erkennen Sie adversariale Angriffe
Um sich vor adversarialen Angriffen zu schützen, benötigen Unternehmen eine robuste Sicherheitsstrategie mit proaktiver, mehrschichtiger Abwehr.
Kontinuierliche Überwachung
Damit keine Bedrohung unentdeckt bleibt, sollten Unternehmen ihre Systeme für maschinelles Lernen kontinuierlich überwachen. Dafür können Sicherheitstools eingesetzt werden, die Assets und Infrastruktur eines Unternehmens laufend überwachen.
Auch die kontinuierliche Überwachung von KI-Eingaben und -Ausgaben hilft Unternehmen, Anomalien zu erkennen, die auf einen adversarialen Angriff hindeuten können. Weitere Möglichkeiten zur kontinuierlichen Überwachung sind Tools zur Analyse von Protokollen auf verdächtige Aktivitäten, Verfahren zur Eingabevalidierung und -bereinigung sowie die regelmäßige Bewertung der Modellleistung. Wenn ein AppSec-Team KI in seinen Arbeitsabläufen einsetzt, ist außerdem ein Sicherheitstool unverzichtbar, das Schwachstellen kontinuierlich erkennt und schädlichen oder unsicheren Code aufspürt.
Adversariales Training
Wenn Sie Ihr Modell mit adversarialen Beispielen trainieren, kann das seine Sicherheit erhöhen. Werden adversariale Beispiele in die Trainingsdaten aufgenommen, lernt Ihr Modell, Bedrohungen zu erkennen und sich dagegen zu schützen.
Schulung und Sensibilisierung
Neben den geeigneten Tools und dem Training eines Modells sollten die Nutzer und Teams eines Unternehmens die Anzeichen eines adversarialen Angriffs, die damit verbundenen Bedrohungen und die Möglichkeiten zur Meldung verdächtiger Aktivitäten kennen. Da adversariale Angriffe darauf abzielen, unentdeckt zu bleiben, können Schulung und Sensibilisierung Bedrohungen aufdecken oder auf Veränderungen aufmerksam machen, bevor diese einem Unternehmen oder seinen Systemen schaden.
Mit Snyk gegen KI-Angriffe schützen
Eine starke Sicherheitslage ist entscheidend, um Ihr Unternehmen vor KI-Angriffen zu schützen. Eine Plattform wie Snyk schützt Ihr Unternehmen vor adversarialer KI, sichert den SDLC ab und stellt sicher, dass jedes Asset und jede Anwendung geschützt ist. Wenn Ihr Entwicklungsteam KI in seine Arbeitsabläufe integriert, kann Snyk Code den Code während der Entwicklung absichern, indem es ihn scannt und in Echtzeit Korrekturen empfiehlt.
Übernehmen Sie die Kontrolle über AI-Security mit Snyk
Erfahren Sie, wie Snyk den von AI generierten Code Ihrer Entwicklungsteams absichert und Ihren Security-Teams zugleich vollständige Transparenz und Kontrolle bietet.