In this article
データ流出を未然に防ぐ:実証済みの9つの戦略
Snyk Team
重要なポイント
データ窃取は多くの攻撃の最終段階であり、最も深刻な被害をもたらします。
検知には、トラフィック分析、行動監視、エンドポイントの可視化が必要です。
防止には、アクセス制御、暗号化、多要素認証(MFA)、ユーザー教育が不可欠です。
攻撃者は現在、生成AIを活用して、攻撃の隠蔽性、自動化、欺瞞性を高めています。
事前にインシデント対応計画を策定しておくことで、対応の成果を高められます。
データ窃取とは、機密情報や保護対象の情報が、許可なく組織の外部に持ち出されることです。内部関係者、マルウェア、外部の攻撃者などが実行します。時間をかけて密かに行われることもあれば、即座に壊滅的な被害をもたらすこともあります。
検知と防止には、技術的な保護対策、従業員へのトレーニング、リアルタイムの対応計画を組み合わせた多層的な戦略が必要です。
データ窃取とは?
データ窃取とは、データを外部の送信先へ不正に転送することです。偶発的に発生する場合もあるデータ漏えいとは異なり、窃取は常に意図的に行われます。また、侵入経路を指す「情報漏えい」とも異なり、窃取は攻撃者が侵入した後に発生します。
どのようなデータが狙われるのか?
個人識別情報(PII) — 氏名、社会保障番号、住所
知的財産 — ソースコード、設計、社内調査資料
金融情報 — 銀行口座情報、クレジットカード情報
医療記録 — 患者の病歴、治療計画
政府関連ファイル — 制限付きまたは機密扱いのデータ
企業戦略に関する文書 — 合併計画、取締役会のやり取り
データ窃取はどのように行われるのか
データ窃取は、常に大々的、あるいは即座に行われるとは限りません。攻撃者は、隠蔽性、速度、アクセス権限のレベルに応じて手口を選びます。数週間かけて少しずつデータを抜き取る場合もあれば、数分ですべてを持ち出す場合もあります。一般的な手口ごとに、どのように窃取が行われるかを見てみましょう。
ネットワークを介した窃取
DNSトンネリング:盗んだデータを、正規のものに見えるDNSクエリに埋め込みます。通常のドメイン検索を装うため、基本的なファイアウォールをすり抜け、密かな通信経路を作り出すことがよくあります。
HTTPSに偽装:マルウェアは、外部へ送信するデータを通常のHTTPSトラフィックに偽装します。暗号化され、信頼されたポートを経由するため、ディープパケットインスペクションを導入していないと検知を逃れる可能性があります。
旧式プロトコルの悪用(FTP、SMTPなど):FTPやSMTPなどの古いサービスは、今も多くの環境で使われています。攻撃者は設定不備を悪用し、盗んだデータをアップロードしたり、メールの添付ファイルに紛れ込ませて持ち出したりします。
エンドポイントを介した窃取
USBデバイス:数秒間接続しただけのUSBメモリで、数ギガバイトのデータが盗まれる可能性があります。物理的にアクセスできる内部関係者は、ファイルをローカルにコピーすることで、ネットワークの防御を完全に回避できます。
スクリーンショット取得ツール:ファイルではなく画面画像を取得するマルウェアもあります。機密性の高いダッシュボード、文書、コードを1フレームずつ記録します。こうした攻撃は軽量で、厳格なエンドポイント監視がなければ検知が困難です。
ファイル同期ツールの悪用:許可されていないDropboxやGoogle Driveのアカウントが、バックグラウンドでひそかにファイルを同期することがあります。適切な制御がなければ、攻撃者や内部関係者が警報を鳴らすことなくデータを持ち出せてしまいます。
ソーシャルエンジニアリングと人を介した攻撃
アクセス権を狙うフィッシング:巧妙なメール1通で、認証情報を共有させたり、悪意のあるリンクをクリックさせたりすることができます。その後、攻撃者は正規のユーザーになりすまし、正当なIDを使ってデータを窃取します。
権限の操作:攻撃者は侵入するのではなく、うまく頼み込むこともあります。ヘルプデスクやサポート担当者をだましてパスワードをリセットしたり、アクセス権限を昇格させたりしたうえで、新たに得た権限を使ってデータを窃取します。
クラウドやサードパーティの悪用
クラウドストレージの設定不備(S3バケットなど):権限設定が緩い公開ストレージは、攻撃者にとって格好の標的です。アクセス制御が適切に設定されていなければ、攻撃者は何かをハッキングする必要もなく、ただダウンロードするだけです。
セキュリティ対策が不十分なAPI:認証のないAPIから、レコードやメタデータ、さらにはデータセット全体が漏えいする可能性があります。攻撃者はこうしたエンドポイントを積極的にスキャンし、自動化したクエリで悪用します。
サプライチェーンの脆弱性:ベンダーやサードパーティのサービスは、見えにくいリスクをもたらすことがよくあります。インテグレーションのセキュリティ対策が不十分だと、攻撃者に環境へのバックドアとして悪用される可能性があります。
AIを活用したデータ窃取の手口
攻撃者は、手作業や既成のツールキットだけに頼るのではなく、AIを使って攻撃を強化するようになっています。こうしたツールにより、従来の手法よりも速く、巧妙に、そして状況に応じて柔軟にデータを窃取できます。組織がAIを取り入れるのと同じように、攻撃者もAIを活用し、環境を把握し、ユーザーになりすまし、防御を回避しようとしています。
まず、AIを活用した偵察から始まります。攻撃者は機械学習を使ってデータの流れや資産同士の関係を把握し、弱点を数分で特定します。かつては手作業で何日もかかった調査を、今では高い精度で自動化できます。
次に、LLMを活用したソーシャルエンジニアリングが行われます。生成AIは、社内の口調や言葉遣いを巧みにまねたフィッシングメールや、ヘルプデスクとのやり取りを思わせるメッセージを作成できます。こうした標的に合わせたメッセージは、認証情報の窃取や権限昇格を招きやすくし、さらに深いアクセスへの道を開きます。
最後に、生成AIによって窃取の手順そのものも自動化されます。攻撃者は、環境に応じて動作を変えたり、通信パターンを偽装したり、攻撃を防ぐためのセキュリティ制御を悪用したりするスクリプトを作成できます。こうしたスクリプトはますます検知を逃れやすくなっており、行動分析を組み合わせていないルールベースの検知システムをすり抜けることも少なくありません。
データ窃取を検知・防止するための9つの実証済み戦略
1. すべての送信トラフィックを監視して異常を検知する
データ窃取では、ほぼ必ず情報がネットワークの外部へ送信されます。多くの場合、その動きは巧妙に隠されています。送信トラフィックのパターンを監視し、宛先、量、タイミングに異常があればアラートを発することは、データ窃取を検知するための基本です。ただし、規模も重要です。従来のトラフィックフィルタリングでは、最新のクラウドアーキテクチャや急速に変化するAIネイティブアプリケーションへの対応に苦労します。
Snykのようなプラットフォームを使えば、セキュリティチームはコンテキストを考慮したインサイトで異常を検知できます。すべてのAPI呼び出し、リポジトリ上の操作、AIモデルの依存関係を可視化することで、通常のソフトウェアの動作と実際の窃取の兆候を見分けられます。これにより、窃取が成功する前に先回りして脅威を調査できます。
2. 行動分析とAI検知モデルを活用する
単純なルールだけでは不十分です。データ窃取の手口は、シグネチャの更新よりも速く進化します。特にAIを活用した行動分析なら、状況や確立された通常パターンからの逸脱に基づいて、不審な活動を検知できます。たとえば、開発者が突然、機密性の高い人事記録にアクセスし始めたり、深夜に大規模なデータセットをエクスポートしたりした場合に気づけることが重要です。
3. LLMの利用とプロンプトインジェクションにガードレールを設ける
窃取はネットワーク経由で起きるとは限りません。プロンプトを通じて起きることもあります。従業員も攻撃者も、悪意のある、または範囲が広すぎるクエリを作成して、AIアシスタントから機密データを引き出す可能性があります。プロンプトインジェクションと呼ばれるこの手口では、AIモデルの応答を通じて、独自のコード、シークレット、顧客データが外部に流出するおそれがあります。
AIコーディングのガードレール
GitHub CopilotやGemini Code AssistなどのAIコーディングツールを、安全なガードレール、利用ポリシー、IDEベースのテストを活用して導入する方法をご紹介します。
4. 承認されていないコラボレーションツールの利用を追跡する
許可されていないSaaSツールや、組織の管理外で使われるコラボレーションアプリは、データを組織の外部へ持ち出す簡単な手段になります。個人用Dropboxフォルダへのファイルのアップロードや、公開Slackチャンネルへの貼り付けも、悪意のあるスクリプトと同じくデータ窃取にあたります。利用中のツールに暗号化やログ記録がないと従業員が知らない場合、問題はさらに深刻化します。
データ窃取を防ぐうえで最も有効なのは、可視化を自動化することです。AIネイティブなコード分析とクラウドインテグレーションにより、Snykは未承認の依存関係、ソースコード内の認証情報、許可されていないアプリへのAPI呼び出しをチームが検知できるよう支援します。開発者がオープンソースのプラグインを使ったり、外部サービスを呼び出したりする際にも、セキュリティチームは状況に応じて、そうした操作がデータを危険にさらすかどうかを確認できます。
5. コード内の認証情報とシークレットを保護する
コードにハードコードされたシークレットは、データ窃取を狙う攻撃者によく標的にされます。特にDevOpsやMLパイプラインでは注意が必要です。APIキー、認証情報、SSHトークンを悪用されると、攻撃者はアラートを発生させずに横展開してデータを窃取できます。
6. AI生成コードを検証して保護する
生成AIを使ったコーディングツールが一般化するにつれ、攻撃者はそれらのツールが生成するコードを狙うようになっています。バックドアを仕込んだり、データを漏えいさせる機能を生成させたりすることで、AI生成コードという新たな攻撃対象領域が生まれます。
7. 最小権限とゼロトラストの制御を導入する
過剰なアクセス権限は、データ窃取を容易にします。人間かマシンかを問わず、内部ユーザーに不要な権限が与えられていると、攻撃者が狙える範囲が広がります。最小権限を徹底すれば、認証情報が侵害されても、窃取される可能性のあるデータの範囲を抑えられます。
8. AIシステムにレッドチーム演習を実施する
実際の攻撃者は、創意工夫を凝らします。自動スキャナーや静的ルールだけでは、すべてを検知できません。特にLLMを基盤とするアプリケーションに対してAIシステムのレッドチーム演習を行うことで、プロンプトの連鎖、出力の操作、モデルの悪用を通じてデータが窃取される可能性のある境界ケースを明らかにできます。
AI-SPM(AIソフトウェア・ポスチャー・マネジメント)の機能を活用すれば、モデルの来歴やエージェント型ワークフローなど、AI固有のコンポーネントを可視化できます。これにより、レッドチームは実環境に即した攻撃をシミュレーションし、攻撃者に先を越される前にデータ窃取の経路を検証できます。
9. セキュリティを開発の早い段階から組み込み、デプロイ前に脆弱性を修正する
データ窃取攻撃の多くは、古いライブラリ、設定不備のあるAPI、脆弱な認証経路といった脆弱性から始まります。データがネットワークの外へ流出し始めてからでは、修正が間に合いません。
Snykは開発者のワークフローに直接組み込まれ、コードの記述中にセキュリティ上の問題を検知して修正できます。これには、ランタイムのコンテキストとビジネスリスクに基づいて優先順位付けされたスキャンも含まれます。SDLCの早い段階で修正に取り組み、AIで修正を迅速化することで、組織はデータ窃取が試みられる隙を減らせます。
誰がデータを窃取しているのか?
データ窃取を実行するのは、動機や手口がそれぞれ異なるさまざまな攻撃者です。効果的なセキュリティ対策を講じるには、攻撃者の特徴を理解することが重要です。
1. 不満を抱えた内部関係者
内部関係者とは、正当なアクセス権を持つ従業員、契約社員、元従業員のことです。検知が最も難しい脅威のひとつとなる可能性があります。有効な認証情報を使って、アラートを発生させることなく、ひそかにデータを窃取できます。動機は、個人的な不満、金銭的な利益、報復などさまざまです。
2023年から2024年にかけて、内部関係者によるデータ漏えいインシデントは28%増加しました。こうした増加にもかかわらず、組織のうち内部脅威への対応に十分備えていると感じているのはわずか29%です。一方で、76%は過去5年間に内部脅威の活動が増加したと報告しています。
注目すべき事例は2025年に発生しました。Western Sydney Universityの元工学部生が、20件のサイバー犯罪容疑で起訴されました。学生の機密記録を100GB以上不正に取得した疑いが持たれています。大学との個人的な争いが動機とされるこの攻撃で、データをダークウェブ上で暗号資産40,000ドル相当で売却しようとしたと報じられています。
2. 犯罪グループ
組織的なサイバー犯罪グループは、主に金銭的な利益を目的としています。機密データを盗み、ダークウェブのマーケットプレイスで販売したり、身代金目的で人質に取ったり、標的を絞った詐欺や恐喝に利用したりします。こうした攻撃は迅速かつ効率的で、一部が自動化されている場合も少なくありません。
2024年には、ランサムウェアや恐喝関連の攻撃の94%でデータ窃取が関与していました。このことから、現代のサイバー犯罪経済においてデータ窃取が中心的な手口になっていることがわかります。
採用ソフトウェアを提供するTalentHookでは、2025年5月に、Azure Blobストレージコンテナーの設定ミスが原因で情報漏えいが発生しました。この不備により、個人情報を含む約2,600万件の履歴書が流出し、フィッシングやなりすましに悪用されるおそれがありました。
3. 国家支援型の攻撃者
国家支援型の攻撃者は、金銭的利益ではなく情報収集を目的としています。こうした国家の支援を受けるグループは、政治的、経済的、または軍事的な優位性を得るため、重要インフラ、政府機関、民間企業を標的にします。攻撃は計画的かつ長期にわたり、長期間にわたって発覚しないことも少なくありません。
攻撃の帰属先を特定するのは困難ですが、こうした攻撃は世界的に増加しており、特に地政学的価値の高い分野が狙われています。
2024年12月、米国財務省は中国政府の支援を受けたハッカーに関連する情報漏えいを確認しました。攻撃者はリモートサポートSaaSプラットフォームの脆弱性を悪用し、機密性の高い省庁システムにアクセスしました。現代の諜報活動がクラウド環境やサードパーティ製ソフトウェアを舞台に展開されることが増えている一例です。
4. ハクティビスト
ハクティビストの動機は金銭的利益ではなく、思想や信念です。政治的・社会的な主張を広めるために、政府、企業、組織を標的にし、相手の評判を損ねたり、業務を妨害したりすることを狙います。
手口はますます巧妙化しており、一部のグループは高度な戦術を使って機密データを窃取し、影響を最大化するために公開しています。
2023年10月、大英図書館がRhysidaハッカーグループの標的となりました。図書館が20ビットコインの身代金要求を拒否すると、攻撃者は利用者や職員の個人情報を含む約600GBの内部データをオンラインで公開しました。この攻撃は広範囲に混乱をもたらし、ハクティビストグループが主張を示すためにデータを武器として利用する可能性を浮き彫りにしました。
5. 高度持続的脅威(APT)
高度持続的脅威(APT)とは、攻撃者がネットワークに侵入し、長期間発覚を免れる、標的を絞ったサイバー攻撃です。攻撃者は十分なリソースと忍耐力、戦略を備えていることが多く、検知を避けるため、長期間にわたって少しずつデータを窃取します。
APTは医療、金融、政府などの重要分野を標的にすることが多く、脆弱な認証情報、未適用のパッチ、多要素認証の不備を悪用します。
よくある質問
データ漏えいとデータの持ち出しの違いは何ですか?
漏えいは、メールを誤った宛先に送信してしまうなど、偶発的に起こることがよくあります。一方、データの持ち出しは、悪意ある攻撃者が意図的にデータを盗み出したり、転送したりすることです。
暗号化で情報の持ち出しを防げますか?
被害を抑える効果はあります。データが暗号化された状態で持ち出され、攻撃者が鍵を持っていなければ、内容を読み取ることはできません。ただし、暗号化だけでは十分な防御とは言えません。
クラウドサービスはデータの持ち出しが起きやすいのでしょうか?
クラウドサービスではアクセス経路が増え、責任も共有されます。設定ミス、過剰な権限、管理されていないAPIによって、リスクが高まります。
AIは情報の持ち出しを検知できますか?
はい。AIはログや行動を分析し、異常をリアルタイムで検知できます。また、目立たないように行われる、低速かつ少量の情報持ち出しも特定できます。
データの持ち出しが検知された場合、対応チームは何をすべきですか?
直ちにアクセスを遮断し、フォレンジック分析を開始して、関係者に通知します。認証情報をローテーションし、必要に応じて規制当局に報告してください。
データが外部に持ち出される前に防ぐ
データ窃取は攻撃の最終段階であることもありますが、多くの場合、最も深刻な被害をもたらします。情報が一度外部に流出すると、規制上の制裁、評判の低下、顧客離れ、長期にわたる信頼の失墜へと影響が広がります。
こうした脅威から身を守るには、従来型の防御を超えた対策が必要です。データの流れを可視化し、AIツールにガードレールを設け、窃取が成功する前に試みを検知する早期警告システムを導入しましょう。
何よりも、開発ライフサイクルそのものに保護を組み込むことが重要です。Snykを使えば、コード、依存関係、コンテナ、インフラのリスクをスキャンすると同時に、AI生成物を保護し、シークレットの漏えいを防止できます。
AIシステムを保護し、機密データが外部に持ち出されるのを防ぐには、新たなアプローチが必要です。
SnykのAI Software Posture Management(AI-SPM)は、従来のセキュリティの枠を超え、AI固有のリスクを可視化し、LLMの利用にガードレールを適用するとともに、AIが生成する脆弱性から保護します。 今すぐ、AIに潜むリスクを確認しましょう。