In this article
Au-delà de la prévisibilité : sécuriser l’IA générative non déterministe dans le cyberpaysage actuel
Qu’est-ce que l’IA non déterministe ?
Contrairement aux logiciels traditionnels, dont la logique est déterministe, ces modèles d’IA générative non déterministes produisent des réponses probabilistes susceptibles de générer des informations erronées, de recommander du code malveillant ou d’exposer des données sensibles en raison de schémas d’inférence inattendus. Ces systèmes d’IA peuvent produire des résultats différents à partir d’entrées identiques : leur comportement est donc imprévisible par nature et difficile à sécuriser.
Comment sécuriser des systèmes dont nous ne pouvons pas entièrement prévoir ni contrôler le comportement ? Les méthodes traditionnelles de cybersécurité ne s’appliquent tout simplement pas aux technologies qui fonctionnent selon des probabilités plutôt qu’une logique binaire. Notre secteur a urgemment besoin de nouveaux cadres, méthodes et paradigmes de sécurité conçus spécifiquement pour la nature non déterministe des systèmes d’IA modernes.
Le défi d’une sécurité imprévisible
L’accélération du déploiement de l’IA nous confronte à un paradoxe inédit en matière de sécurité. Cet écart crée des vulnérabilités critiques, notamment au vu des différences fondamentales entre les systèmes d’IA déterministes et non déterministes.
Conséquences des systèmes déterministes et non déterministes sur la sécurité
Les systèmes déterministes traditionnels produisent des résultats prévisibles, ce qui permet de mettre en place facilement des contrôles de sécurité. Cependant, la nature non déterministe de l’IA générative introduit des vulnérabilités probabilistes que nous apprenons encore à traiter. Une même invite peut produire des résultats différents, ce qui complique la validation de la sécurité et la modélisation des menaces.
Les causes techniques des hallucinations de l’IA générative
Les hallucinations de l’IA générative sont dues aux incohérences des données d’entraînement, aux défaillances des mécanismes d’attention et au surapprentissage de schémas incomplets. Du point de vue de la sécurité, ces hallucinations se traduisent par des risques importants pour la cybersécurité :
Hallucinations de packages : 20 % des suggestions de code générées par l’IA font référence à des bibliothèques inexistantes. En moyenne, le taux de packages hallucinés est d’au moins 5,2 % pour les modèles commerciaux et de 21,7 % pour les modèles open source.
Slopsquatting : les attaquants exploitent ces hallucinations en créant des packages malveillants portant des noms suggérés par l’IA.
L’évolution des injections de prompt
Les attaques par injection de prompt vont au-delà de la manipulation directe. Des injections indirectes sophistiquées ont été observées : des instructions malveillantes sont dissimulées dans des sources de données externes, comme des PDF ou du contenu Web, que l’IA traite. Un formulaire de commentaires client en apparence anodin peut contenir des prompts cachés qui compromettent le comportement de l’IA.
Application du cadre MITRE ATLAS
Le cadre MITRE ATLAS classe systématiquement ces menaces adverses. Des techniques comme les compromissions de la chaîne d’approvisionnement du machine learning (AML.T0010) sont directement liées aux vulnérabilités dues aux hallucinations de packages, tandis que la catégorie Prompt Injection porte sur la surface d’attaque croissante des injections.
Les vulnérabilités critiques de l’IA non déterministe
À mesure que les systèmes d’IA deviennent partie intégrante de notre infrastructure de sécurité, nous faisons face à des vulnérabilités sans précédent qui exigent une attention immédiate.
Principales catégories de vulnérabilités
Attaques par manipulation de modèles
Attaques par injection de prompt exploitant les composants probabilistes pour contourner les contrôles de sécurité.
Entrées adverses conçues pour fausser les processus décisionnels des modèles.
Techniques d’inversion de modèles visant à extraire des données sensibles d’entraînement.
Empoisonnement des données d’entraînement
Injection de données malveillantes pendant les phases d’entraînement des modèles.
Attaques par porte dérobée intégrant des déclencheurs cachés dans les systèmes d’IA.
Corruption des données nuisant à la fiabilité et à la précision des modèles.
Risques liés à la chaîne d’approvisionnement
Dépendances à des modèles tiers introduisant des vulnérabilités inconnues.
Contamination des modèles préentraînés par des sources en amont.
Vérification insuffisante des frameworks et bibliothèques de développement de l’IA.
Problèmes de dépendance excessive
Des développeurs juniors qui se fient excessivement au code généré par l’IA sans le valider correctement.
Des systèmes décisionnels automatisés qui fonctionnent sans supervision humaine suffisante.
Des fonctions de sécurité critiques confiées à des résultats d’IA non vérifiés.
Pourquoi les tests traditionnels ne suffisent pas
Les directives OWASP sur l’IA générative expliquent précisément pourquoi les approches classiques de tests de sécurité échouent avec les systèmes non déterministes. Les tests d’intrusion traditionnels supposent que les réponses du système sont prévisibles, mais la nature probabiliste des systèmes d’IA crée des angles morts dans nos évaluations de sécurité.
Nous avons besoin de méthodes de test adaptatives qui tiennent compte des éléments suivants :
Des résultats non déterministes nécessitant une validation statistique
La dérive des modèles qui affecte la posture de sécurité à long terme
Des vulnérabilités contextuelles issues des données d’entraînement
Élaborer des défenses efficaces
Les approches de sécurité de l’IA connaissent une évolution majeure, car les organisations reconnaissent la nécessité de cadres de défense complets. Le paysage a évolué rapidement et exige des méthodes structurées pour contrer les menaces émergentes.
Principaux cadres de sécurité de l’IA (2024-2025)
Le cadre de gestion des risques liés à l’IA du NIST (AI RMF) propose l’approche la plus complète sur l’ensemble du cycle de vie : il couvre la gouvernance, la cartographie des risques, leur mesure et leur gestion à chaque étape du développement de l’IA. En juillet 2024, le NIST a publié le Generative AI Profile (NIST-AI-600-1), qui traite spécifiquement des risques liés à l’IA générative. Nous le recommandons comme cadre de référence pour les déploiements en entreprise.
Le cadre de sécurité de l’IA de Microsoft cible spécifiquement les menaces adverses et offre une protection robuste contre l’empoisonnement des modèles et les attaques par injection de prompt. Son approche met l’accent sur la modélisation des menaces et les principes de sécurité dès la conception.
Le SAIF de Google (Secure AI Framework), associé à la Coalition for Secure AI (CoSAI), définit des normes de collaboration à l’échelle du secteur, axées sur la sécurité de la chaîne d’approvisionnement et la vérification de la provenance des modèles.
Les directives de la CISA pour les infrastructures critiques répondent aux exigences propres à chaque secteur et sont particulièrement utiles aux organisations qui gèrent des services essentiels et des applications liées à la sécurité nationale.
Mesures concrètes pour mettre en œuvre la défense de l’IA non déterministe
Déployez la génération augmentée par récupération (RAG) pour réduire les hallucinations en fondant les réponses sur des bases de connaissances vérifiées.
Mettez en place une surveillance à l’exécution et évaluez en continu le comportement des modèles afin de détecter en temps réel les anomalies et les entrées adverses grâce à l’analyse statistique et à des profils comportementaux de référence.
Configurez le filtrage des résultats à l’aide de couches de validation du contenu qui assainissent les réponses avant leur diffusion, afin d’éviter les fuites de données et la génération de contenu inapproprié.
Établissez des garde-fous de sécurité reposant sur des moteurs d’application des politiques pour respecter les limites de conformité et empêcher tout comportement non autorisé des modèles.
Intégrez des outils d’évaluation des risques, comme Snyk AppRisk, pour détecter systématiquement les vulnérabilités liées à l’IA tout au long de votre pipeline de développement et mieux connaître les dépendances des modèles ainsi que votre posture de sécurité.
Cadre de réponse aux incidents liés à l’IA générative non déterministe
Analyse du comportement des modèles - Suivi des schémas d’injection de prompt
Contamination des données d’entraînement - Identification des jeux de données empoisonnés
Surveillance des résultats - Détection des hallucinations et de la dérive des biais
Snyk Code pour l’analyse statique du code des applications d’IA et Snyk IaC pour le déploiement sécurisé de l’infrastructure s’intègrent facilement aux pipelines CI/CD et permettent une détection précoce des vulnérabilités avant le déploiement en production.
Snyk AI Trust Platform permet d’élaborer des stratégies de défense en profondeur, essentielles à la mise en production des systèmes d’IA. Il est crucial de choisir les cadres adaptés au profil de risque de votre organisation et de mettre en place des protections à plusieurs niveaux qui répondent aux exigences techniques et de gouvernance.
Prêt à aller au-delà des méthodes traditionnelles de cybersécurité ? Téléchargez dès aujourd’hui l’e-book AI TrustOps.
Vous utilisez l’IA dans votre développement ?
Le cadre AI TrustOps de Snyk vous guide pour mettre en place et faire évoluer des pratiques de développement sécurisé de l’IA dans ce nouveau paysage des risques liés à l’IA.