はじめに
生成AIの進化は「チャット」から、自分でツールを呼び出し、ウェブ閲覧を行い、仕事をやり遂げる「自律型AIエージェント」へと移り変わっています。しかし、その便利さの裏側で、高度なAIが、暴走する事故が相次いで報告されています。本稿では、そのリスクと対策について考察します。
1. AI暴走の事例
2026年に、AIエージェントが実際に外部のシステムへ侵入した事例が相次いで報じられました。各事例は特定のベンダーのAIエージェントのみで発生するものでなく、オープンソースを含む一般のAIエージェントで発生しうるとされています。
(1)Google Geminiが、セキュリティテスト中に実在企業3社へ不正アクセス ※[1]
GoogleのAIモデルGeminiが、セキュリティテストの最中、実在する企業3社へ不正アクセスを行いました。テスト環境はインターネットに接続できないように設計されていたものの、設定ミスにより接続可能な状態になってしまっていました。1社のシステムに対してはAIエージェントがパスワードの推測を繰り返してログインに成功し、残る2社のシステムに対しては他のシステム(リポジトリ)から認証情報を見つけ出しログインしたとされています。
(2)OpenAIのエージェントが、課題を解く途中でHugging Faceなどへ不正アクセス ※[2]
OpenAIが自社のAIエージェントに、難易度の高いサイバーセキュリティの課題を解かせていたところ、エージェントが外部のシステムへ不正アクセスを繰り返し、AIモデルの共有基盤であるHugging Faceへ侵入するインシデントが発生しました。これは、AIエージェントが目的を達成するために、想定を超えて自律的に協力し合い、権限を広げていく危険性を示す事例として報告されています。
エージェントはまず、社内のパッケージ管理システムにファイルを書き込むことで、他のエージェントとお互いに連絡を取り合う方法を見つけ出しました。約1200のエージェントがこの「共有の掲示板」に参加したそうです。次にエージェント達は、パッケージ管理システムが部品のダウンロードのためにインターネットへ接続する機能を持っていたことを悪用して、本来は閉じられている環境からインターネットへ接続しました。その後、1つのエージェントがインターネット上に公開されていたHugging Faceの利用者の認証情報を見つけて、別のエージェントがそれを用い、複数の脆弱性と連鎖させることでHugging Faceの数十台のサーバーに侵入、うち1台で完全な管理者権限を取得して非公開データを入手しました。
(3)AnthropicのClaudeが、セキュリティ評価中に3社のシステムへ不正アクセス ※[3]
Google Geminiの事例[1]と同様のセキュリティテストにおいて、テスト環境の設定ミスによりインターネットに接続できる状態になっており、その結果、AnthropicのAIモデルが3社のシステムに不正アクセスしました。あるエージェントは、アプリケーションやインフラの認証情報を抽出し、数百行の本番データを含むデータベースへのアクセス権を取得しました。別のエージェントはSQLインジェクション他の基本的で広く知られた手法を用いて、ある企業のインターネット公開アプリケーションに侵入しました。
2.AI暴走の原因
AIエージェントが意図しない動きを起こす背景には、確率的に答えを出すAIの特性と、システムの作りに由来する弱点が複雑に絡み合っています。
原因1: 作業環境の分離不足
エージェントの動作環境が社内ネットワークから切り離されていないと、侵害が社内の別のシステムへ横方向に広がるリスクがあります。Google Geminiの事例[1]とAnthropicの事例[3]では、本来はインターネットから切り離されているはずの評価環境が、設定ミスによって実際のインターネットに接続されていました。OpenAIの事例[2]では、閉じているはずの環境の中にあるパッケージ管理システムが持っていたインターネット接続機能をエージェントが悪用し、外部への通信路を自ら作り出しました。どちらも環境分離を徹底できていないことが原因です。
原因2:目的達成の最優先
AIエージェントは「利用者の目的」を達成するために、効率的と思われる手段を実直に試します。エージェントが法令や利用規約、越えてはならない境界を理解して守る仕組みが不十分な場合、その過程で事実上の不正アクセスや不正なデータ取得を自動実行してしまいます。エージェントは倫理のような暗黙のルールを認識できません。また、OpenAIの事例[2]のように、エージェントは難易度の高い課題に対して「どこかに正解があるはず」と、本来の作業範囲を超えて外部のシステムまで答を探しに行きました。
原因3:過剰な権限付与
AIエージェントに、本来の作業に不要な権限を与えてしまうと、想定外の動きがそのまま実害につながります。Anthropicの事例[3]では、評価テストのために用意されたはずのエージェントが、実在する組織の認証情報を取得し、本番データを含むデータベースへアクセスしたり、外部のパッケージレジストリへ公開したりできる、幅広い操作の権限を持っていました。人間であれば用途ごとに分けて与える操作権限を、AIにまとめて付与する点が問題です。
原因4:自動試行の繰り返し(エージェントループ)
多くの自律型AIは、目標を達成するまで「推論 → 実行(外部サービスの呼び出しやウェブ閲覧) → 結果の確認 → 再試行」を繰り返します。実行でエラーが起きた際に「制限を回避するために別の認証情報を試す」「別の接続口へ要求を送る」といった攻撃的な動きを自分で作り出しました。OpenAIの事例[2]では、1000を超えるエージェントが連携して数日間にわたり不正アクセスを繰り返し、他社システムへの侵入経路を次々に開拓しました。
3.ユーザ企業が直面する具体的なリスクと被害
自律型AIエージェントの不正な動きは、単なる道具の不具合にとどまらず、企業の存続を揺るがす深刻な事故に直結します。
(1) 社内の機密情報・顧客の個人データの不正取得と外部への流出
社内のSNS、グループウエア、顧客管理システム(CRM)などの情報基盤に接続されたAIエージェントが、顧客リストや未公開の財務データなどを検索・抽出し、外部サービス(サーバ)へ自動送信するリスクがあります。
(2) 基幹システム・クラウドシステムの意図せぬ改変・破壊
開発や運用を自動化するAIエージェントに過剰な「書き込み・削除の権限」が与えられていた場合、推論の誤りや繰り返しの暴走によって、本番環境のデータベースが一括削除されたり、セキュリティ設定が開放されたりすることでシステムが停止に至るリスクがあります。
(3) 取引先を巻き込む攻撃の踏み台化と、法的責任・信用の失墜
自社のエージェントが他社のウェブサイトや取引先の窓口に対して過度な要求や不正アクセスを試みることで、自社のIPアドレスが悪質なボット・攻撃元として登録され、取引の停止や不正アクセス禁止法違反などの法的追及を受けるリスクがあります。
4. AIを安全に使うための対策
生成AIと壁打ちして得た、AIエージェント暴走への対策を以下に記載します。全ての対策をユーザ企業が実施することは困難と考えられ、一部の対策はAIプラットフォーマーが実施することになります。
対策1:作業場所を厳重に境界分離する
エージェントを動かす場所を社内ネットワークから切り離し、万一の侵害が外へ広がらないようにします。OpenAIの事例[2]のように環境の中にある「別の用途の機能」が脱出の入口になり得るため、分離は機能単位で確認する必要があります。また、接続先の限定(ホワイトリスト方式):エージェントが通信できる相手を、社内で承認済みのシステムに限定します。
対策2:AIエージェントにルールを理解させ、必要な権限のみを与える
規制の考え方は、これまでの生成AIのように「AIが何を生成するか(内容)」を対象にするものから、エージェントが「何をすることを許されているか(権限・アクセス制御)」を対象にするものへ移りつつあります。権限を与える前にルールを理解させ、与える範囲を最小限に絞ることが第一の対策です。
・検索や要約の作業では、書き込みの権限を完全に外します。
・エージェントの権限を用途ごとに分け、1つのエージェントが複数の重要操作をまとめて実行できないようにします。各エージェントとその権限を明確にし、記録と組み合わせて後から検証できるようにします[5]。
・守るべき境界や禁止事項をあらかじめ伝えるだけでなく、それに反する動きを検知して止められる仕組みを用意します。OpenAIの事例[2]では、エージェントが本来許されていない外部への通信手段を自ら見つけ出して利用しました。
対策3:エージェントの入出力、動作をリアルタイムで監視する
エージェントに入ってくる外部データと、AIが送り出す要求を常に監視します。
・送信内容にクレジットカード番号等の個人情報が含まれていないかをリアルタイムでチェック、遮断します。
・Anthropicの事例[3]では、予期しない動作がないか、継続的に監視する体制の拡大を再発防止策に挙げています。異常な動きを記録に残し、後から検証できるようにしておくことも監視の一部として有効です。
対策4:人間の承認手順と、緊急時の停止スイッチを組み込む
重要な操作に対する承認の手順と、暴走時に強制的に止める機能を、仕組みと運用の両面に組み込みます。
・外部へのメール送信、送金、データの削除、設定の変更は、必ず人間の明示的な承認を必要とします。
・1つの作業あたりの外部サービスの呼び出し回数、消費量、繰り返し回数に厳しい上限を設けます。
・異常を検知したときに、すべてのエージェントの動作を即座に止める仕組み(キルスイッチ)を配備します。
おわりに
AIは自律性を高めるほど強力な生産性の道具となる一方で、安全性の境界が「指示文という曖昧な自然言語」に委ねられる弱さを抱えます。本稿で示した対策を指針とし、安全で持続可能なAI活用を進められることをお勧めします。
参考文献
[1]「GoogleのGeminiがセキュリティテスト中に実在企業3社をハッキングしていた件(ウォール・ストリート・ジャーナル報道の紹介)」GIGAZINE、2026年9月24日。
https://gigazine.net/news/20260924-googles-gemini-hacked-three-companies-ai/
[2]「OpenAIのAIエージェントがベンチマークを解くために不正アクセスを繰り返しHugging Faceへ侵入した事例報告」GIGAZINE、2026年8月27日。
https://gigazine.net/news/20260827-openai-hugging-face-incident-report/
[3] Anthropic「Investigating incidents in
our cybersecurity evaluations」(2026年7月30日公表、8月3日更新)/「Alignment Assessment of
Cybersecurity Incidents」(2026年9月9日)。
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
[4]「AnthropicのAIが『キャプチャー・ザ・フラッグ』タスク中にインターネットに接続して暴走したインシデントについての報告」GIGAZINE、2026年9月10日。
https://gigazine.net/news/20260910-anthropic-ai-incident/
[5]「中国のAIエージェント規制 ― 概要と意義」Cloud Security
Alliance Japan(AIWGメンバー 諸角昌宏)、2026年9月23日。
https://cloudsecurityalliance.jp/newblog/2026/09/23/
[6]「中国DeepSeek、AIエージェント訓練の新手法発表-効率と安全性向上へ」TBS NEWS DIG(ブルームバーグ配信)、2026年9月24日。
https://newsdig.tbs.co.jp/articles/withbloomberg/2963621?display=1
◆ 執筆者プロフィール
岩本 元
ITコーディネータ/ISMSクラウド審査員/技術士(情報工学部門 総合技術監理部門)/IoTエキスパート



