In this article
予測可能性を超えて:今日のサイバー環境における非決定論的生成AIのセキュリティ
非決定論的AIとは?
決定論的なロジックフローを持つ従来のソフトウェアとは異なり、非決定論的な生成AIモデルは確率的な応答を生成するため、予想外の推論パターンを通じて誤った情報を幻覚する、悪意のあるコードを推奨する、機密データを漏えいする可能性があります。同じ入力に対して異なる出力を生成するため、動作は本質的に予測しにくく、セキュリティを確保するのも困難です。
完全には予測も制御もできないシステムを、どうすれば安全にできるでしょうか?確率空間で動作し、二値論理に基づかないテクノロジーには、従来のサイバーセキュリティ対策は通用しません。現代のAIシステムが持つ非決定論的な性質に特化した、新たなフレームワーク、方法論、セキュリティのパラダイムが、業界にとって急務となっています。
予測不可能なセキュリティ上の課題
AIの導入が加速するなか、かつてないセキュリティ上のパラドックスに直面しています。この隔たりは重大な脆弱性を生み出します。特に、決定論的AIシステムと非決定論的AIシステムの根本的な違いを考えると、その深刻さが明らかになります。
決定論的AIと非決定論的AIのセキュリティ上の影響
従来の決定論的システムは予測可能な出力を生成するため、セキュリティ制御を容易に実装できます。しかし、生成AIの非決定論的な性質によって確率的な脆弱性が生じており、その対処方法はまだ模索の段階です。同じプロンプトでも出力が異なる可能性があるため、セキュリティ検証は複雑になり、脅威モデリングも困難になります。
生成AIの幻覚が生じる技術的な原因
生成AIの幻覚は、学習データの不整合、アテンション機構の障害、不完全なパターンへの過学習に起因します。セキュリティの観点から見ると、こうした幻覚は重大なサイバーセキュリティリスクとして表れます。
パッケージの幻覚:AIが生成したコードの提案の20%が、実在しないライブラリを参照しています。幻覚によって生成されるパッケージの割合は、商用モデルで平均少なくとも5.2%、オープンソースモデルで21.7%です。
スロップスクワッティング:攻撃者は、AIが提案した名前で悪意のあるパッケージを作成し、こうした幻覚を悪用します。
プロンプトインジェクションの進化
プロンプトインジェクション攻撃は、直接的な操作を超えて進化しています。PDFやウェブコンテンツなど、AIが処理する外部データソースに悪意のある指示を隠す、高度な間接インジェクションの事例も報告されています。一見無害な顧客フィードバックフォームに、AIの動作を侵害する隠しプロンプトが含まれている可能性もあります。
MITRE ATLASフレームワークの活用
MITRE ATLASフレームワークは、こうした敵対的脅威を体系的に分類しています。MLサプライチェーン侵害(AML.T0010)などの手法は、パッケージの幻覚に起因する脆弱性と直接関連します。また、プロンプトインジェクションは、拡大するインジェクション攻撃対象領域に対処します。
非決定論的AIにおける重大な脆弱性
AIシステムがセキュリティインフラに欠かせない存在となるなか、早急な対応を要する前例のない脆弱性に直面しています。
主な脆弱性のカテゴリー
モデル操作攻撃
確率的な要素を悪用してセキュリティ制御を回避するプロンプトインジェクション攻撃
モデルの意思決定プロセスを損なうように設計された敵対的入力
機密性の高い学習データを抽出するモデル反転手法
学習データのポイズニング
モデルの学習段階での悪意あるデータの注入
AIシステムに隠れたトリガーを埋め込むバックドア攻撃
モデルの信頼性と精度に影響するデータ破損
サプライチェーンのリスク
未知の脆弱性を持ち込むサードパーティ製モデルへの依存
上流のソースに由来する事前学習済みモデルの汚染
AI開発フレームワークやライブラリの審査不足
過度な依存の問題
適切な検証を行わず、AI生成コードに過度に依存する若手開発者
十分な人間の監督なしに稼働する自動意思決定システム
検証されていないAIの出力に委ねられる重要なセキュリティ機能
従来のテストでは不十分な理由
OWASPの生成AIガイドラインでは、従来のセキュリティテスト手法が非決定論的なシステムに通用しない理由を具体的に説明しています。従来のペネトレーションテストはシステムの応答が予測可能であることを前提としていますが、AIシステムの確率的な性質によって、セキュリティ評価に死角が生じます。
次の要素を考慮した適応型のテスト手法が必要です。
統計的な検証を必要とする非決定論的な出力
長期的なセキュリティ態勢に影響するモデルドリフト
学習データから生じるコンテキスト依存の脆弱性
効果的な防御を構築する
包括的な防御フレームワークの必要性を認識する組織が増え、AIセキュリティのアプローチは大きく変化しています。脅威の急速な進化に対応するため、体系的な方法論が求められています。
主要なAIセキュリティフレームワーク(2024~2025年)
NIST AIリスクマネジメントフレームワーク(AI RMF)は、AI開発の各段階におけるガバナンス、リスクのマッピング、測定、管理を網羅する、最も包括的なライフサイクルアプローチを提供します。NISTは2024年7月に生成AIプロファイル(NIST-AI-600-1)を公開し、生成AIのリスクに特化して対応しています。企業で導入する際の基盤となるフレームワークとして推奨します。
MicrosoftのAIセキュリティフレームワークは、敵対的脅威に特化し、モデルポイズニングやプロンプトインジェクション攻撃に対する堅牢な保護を提供します。脅威モデリングとセキュリティ・バイ・デザインの原則を重視したアプローチです。
GoogleのSAIF(Secure AI Framework)は、Coalition for Secure AI(CoSAI)と連携して業界全体の協力基準を確立し、サプライチェーンのセキュリティとモデルの来歴検証に重点を置いています。
重要インフラに関するCISAのガイダンスは、分野固有の要件に対応しています。特に、不可欠なサービスや国家安全保障関連のアプリケーションを管理する組織に役立ちます。
非決定論的AIを防御するための実践的な導入ステップ
検索拡張生成(RAG)を導入し、検証済みのナレッジベースに基づいて応答を生成することで、幻覚を抑制します。
ランタイム監視を実装し、モデルの動作を継続的に評価します。統計分析と行動ベースラインを用いて、異常や敵対的入力をリアルタイムで検知します。
出力フィルタリングを設定し、応答を提供する前に内容をサニタイズする検証レイヤーを導入して、データ漏えいや不適切なコンテンツの生成を防ぎます。
セキュリティガードレールを確立し、ポリシー適用エンジンによってコンプライアンスの境界を維持し、許可されていないモデルの動作を防ぎます。
リスク評価ツールを統合します。たとえばSnyk AppRiskを活用し、開発パイプライン全体にわたるAI関連の脆弱性を体系的に特定します。モデル依存関係とセキュリティ態勢を可視化できます。
非決定論的生成AIのインシデント対応フレームワーク
モデルの動作分析 - プロンプトインジェクションのパターンを追跡
学習データの汚染 - ポイズニングされたデータセットを特定
出力の監視 - 幻覚やバイアスのドリフトを検知
AIアプリケーションのコードを静的解析するSnyk Codeと、安全なインフラのデプロイを支援するSnyk IaCは、CI/CDパイプラインにシームレスに統合でき、本番環境へのデプロイ前に早期の脆弱性検知を実現します。
Snyk AI Trust Platformは、本番環境のAIシステムに欠かせない多層防御戦略を実現します。重要なのは、組織のリスクプロファイルに適したフレームワークを選び、技術面とガバナンス面の要件に対応する多層的な保護を実装することです。
従来のサイバーセキュリティ対策にとどまらない方法をお探しですか?今すぐAI TrustOps Ebookをダウンロードしてください。
開発にAIを活用していますか?
SnykのAI TrustOpsフレームワークは、新たなAIリスクの状況に対応しながら、安全なAI開発の実践を構築し、成熟させるためのロードマップです。