フロンティアモデルは脆弱性を発見した。攻撃者だけがエクスプロイトチェーンを見つけた。
2026年10月7日
0 分で読めます攻撃者はリポジトリを読むのではなく、URLにアクセスし、見つけたものをつなぎ合わせます。攻撃者向けAIが実稼働アプリケーションに対して機械の速度で攻撃を仕掛ける時代には、セキュリティツールは脆弱性を見つけるだけでなく、悪用可能であること、さらにはそれらを組み合わせて侵害に至ることまで証明する必要があります。
そこで、私たちはテストを実施しました。Evo Continuous Offensive Security (COS)とMythosを使ったClaude Securityを、同じアプリケーションであるTaintedPortに対して実行しました。これは、実際の脆弱性クラスと登録済みの一連のエクスプロイトチェーンを検証する、意図的に脆弱性を持たせたWebアプリです。これらは異なる種類のツールです。COSは稼働中のアプリケーションを攻撃する一方、2つのClaude製品はソースコードを読みます。それぞれのアプローチで何を証明できるかを確かめるため、同じターゲットで実行しました。
Evo COSは15件中10件のエクスプロイトチェーンを確認しました。
これはモデルへの批判ではありません。私たち自身もモデルを活用しています
Mythosを使ったClaude Securityは、AIによる脆弱性検出を大きく進歩させました。優れた人間のレビュアーのようにソースコードを推論し、パターンマッチング型のツールが見逃す種類の欠陥も検出します。しかし、コード内の欠陥を見つけることと、攻撃者がその脆弱性を悪用できると証明することは、別の仕事です。
COSが証明した攻撃経路
このテストのすべてのツールが、サーバーサイドリクエストフォージェリ(SSRF)の欠陥と、アプリケーションのJWT署名シークレットがハードコードされていることを検出しました。Evo COSはさらに踏み込み、SSRFを利用して稼働中のアプリケーションから署名シークレットを取得し、そのシークレットで有効な管理者トークンを生成して、管理者画面を乗っ取りました。2つの検出結果をつなげてアカウントの完全な乗っ取りに至る経路を構築し、実稼働アプリに対して実行可能な概念実証とともに実証しました。

上図:COSのスコアリングにおけるCHAIN-004。このチェーンを構成する2つの検出結果、SSRFの欠陥とハードコードされたシークレットは、このテストのすべてのツールが個別に報告しました。Evo COSは、これらを組み合わせると管理者トークンを偽造できることを確認しました。
これが、自律型攻撃の実際の姿です。足がかりを得て、そこから攻撃を連鎖させるのです。Evo COSは攻撃経路を示し、確認された各チェーンに実行可能な概念実証を添付します。
結果
TaintedPort v1.35を、既知の脆弱性57件と既知のエクスプロイトチェーン15件を含む固定の正解データと照合し、深刻度に応じて重み付けした尺度(低:1、中:3、高:9、重大:27)で評価しました。確認された各チェーンは、その構成要素となる検出結果に加え、チェーン自体の深刻度に応じてスコアに加算しています。重み付け検出率は、獲得ポイント÷利用可能な938ポイントです。内訳は、脆弱性57件で587ポイント、チェーン15件で351ポイントです。
Evo COS | Claude Security(Mythos) | |
|---|---|---|
深刻度加重検出率 | 75.7% | 49.6% |
確認されたエクスプロイトチェーン(15件中) | 10 | X |
検出された脆弱性(57件中) | 50 | 37 |
F1スコア | 91.7% | 75.5% |
Claude Securityは、重大度が「重大」の脆弱性を1件多く検出しました(9件に対して10件)。Evo COSは脆弱性を最も多く検出し、誤検知を抑えながら最も高い適合率(96.2%対90.2%)を達成し、エクスプロイトチェーンを特定して実証することもできました。
なぜデプロイ済みアプリケーションを攻撃するのか?
Evo COSは動的なシステムです。ターゲットは常に稼働中のURLであり、ソースコードを任意で入力すると、ブラックボックスからグレーボックスへと実行を拡張できます。コードだけを対象に実行することはありません。Claude Securityはホワイトボックス(コードのみ)で実行しました。
そのため、これは異なる専門領域をまたいだ比較です。Evo COSは稼働中のアプリケーションを調査・悪用する攻撃的なペネトレーションテストであり、コードを一度読むだけの作業よりも根本的に集中的なプロセスです。これは、DASTとSASTの間で業界が長年続けてきた相互補完の関係と同じです。ここで示しているのは、稼働中のアプリケーションを実際にテストすることで証明できることと、コードを読むだけでは証明できないこと、つまり、これらの脆弱性が実在し、連鎖することです。
Evo COSだけが報告した検出結果の大半は、実行時の挙動に関するものです。反射された応答や設定ミスのある応答、転送時の保護の欠如、ログアウト後も有効なトークン、脆弱なセッション管理などです。また、コンテキストに依存する複数のビジネスロジック上の欠陥も確認できました。プロフィール更新におけるオブジェクトレベル認可の不備、偽造されたJWTクレームによる権限昇格、そして保存されたTOTPシークレットを一度読み取るだけで2FAが無効になる重大な欠陥です。チェーンを確認するには、稼働中のアプリを通じて各ステップに到達し、次のステップにも実際に到達できることを確かめる必要があります。ソースコードを推論するモデルでは、脆弱性が実行されることを推測しなければならず、チェーンを見逃します。
ハーネスは構築できても、コンテキストは構築できない
今年のベンチマークをめぐる議論から、確かな論点が見えてきました。モデルを取り巻くシステムは、モデル自体よりも重要だということです。私たちはさらに踏み込んで考えます。「どのハーネスを使うか」は中立的な問いではなく、その答えこそが実際の優位性を生み出します。
Evo COSは、最先端のClaudeモデルを含む複数のモデルを連携させ、それぞれが最も得意とする作業を担当させます。つまり、この結果はモデルの品質に関する話ではありません。最先端のコードレビューを支えるのと同じクラスのモデルが、Evo COSの内部でも使われています。異なるのは、その周囲にあるシステムです。Evo COSは、何も手がかりのない状態から推論するのではなく、Snykプラットフォームがすでに把握しているターゲットの情報を起点とします。特定の目的に合わせて連携するエージェント群で構成され、検出結果はすべて独立した検証ステップを経てから提示されます。検出結果を生成するシステム自身が、それを評価すべきではないからです。
誰でも今夜、最先端のモデルをコーディングエージェントにつなぎ、リポジトリを調べさせることはできます。しかし、その構成では、Evo COSが起点とする蓄積・検証済みのコンテキスト、独立した検証機能、そして稼働中のアプリケーションに対するテストを再現できません。
動的テストと静的テストは相互補完する
Claude Securityは、Evo COSが検出できなかった脆弱性を複数見つけました。その多くは、ソースコードから確認できるロジックや、稼働中のアプリを通じては必ずしも表面化しない暗号関連の欠陥です。どちらのアプローチも単独では完全ではありません。だからこそ、単機能のツールではなくプラットフォームが必要なのです。コードを読むことと稼働中のアプリを攻撃すること、それぞれがもう一方の見逃す問題を検出します。
方法
TaintedPortは、Snykが独自に開発・保守する、意図的に脆弱性を持たせた公開アプリケーションです。Evo COSはこのアプリに合わせた調整を行っていません。
ターゲット: TaintedPort:既知の脆弱性57件(一般的な脆弱性34件、ビジネスロジック上の脆弱性23件)と、既知のエクスプロイトチェーン15件。
ツールと入力:
Evo COS:グレーボックス(稼働中のURL+ソースコード)、9月18日。
Claude Security:ホワイトボックス(ソースコード)、拡張思考を有効にしたMythos、9月18日。
実行回数:各ツール1回。結果は単一実行の出力であり、中央値ではありません。
カテゴリ別の検出
カテゴリ | 既知 | Evo COS | Claude Security(Mythos) |
一般的な脆弱性 | 34 | 33 | 21 |
ビジネスロジック | 23 | 17 | 16 |
エクスプロイトチェーン | 15 | 10 | X |
深刻度別の検出数(検出数/既知数)
深刻度 | 既知 | Evo COS | Claude Security(Mythos) |
重大 | 11 | 9 | 10 |
高 | 26 | 22 | 19 |
中 | 18 | 17 | 8 |
低 | 2 | 2 | 0 |
誤検知とF1スコア
指標 | Evo COS | Claude Security(Mythos) |
誤検知 | 2 | 4 |
F1スコア | 91.7% | 75.5% |
再現する: TaintedPortはtaintedport.comで利用できます。
ご自身のアプリケーションで、どの検出結果が連鎖して侵害につながるのか気になりませんか?Evo Continuous Offensive Securityが稼働中のURLをどのようにテストするかをご覧ください。
ライブデモを予約
AIの安全な導入を大規模に実現
Evoは、AIを活用した開発とAIアプリケーション全体を可視化し、ガバナンスとセキュリティを提供することで、組織によるAIの安全な導入と拡大を支援します。
