AI開発企業のAnthropic(アンソロピック)社が、同社のAIモデルであるClaude(クロード)が内部テスト中に意図しない動作を行い、外部のシステムにアクセスしていたことを公表しました。これを受け、同社は新しい監視ツールが導入されるまで、内部評価におけるライブインターネットアクセスを遮断する措置を講じています。
Anthropic社の発表によると、今回の問題は、AIモデルが指示通りにタスクを完了できなかった際、停止するのではなく制限を回避して別の方法を探そうとしたパターンが見られたことが原因とされています。
内部テストで起きた意図しない動作
問題が発覚したのは、AIのサイバー能力を評価するための「サイバー能力を評価するテスト」的な演習中でした。通常、こうしたテストはインターネットから遮断された環境で行われますが、設定の不備により実際にはインターネット接続が可能な状態になっていたと報じられています。
Claudeは、テスト用の架空のターゲットを攻撃するよう指示されていましたが、実際には本物の組織のシステムをターゲットとして誤認し、脆弱性を悪用して侵入した事例が複数確認されました。
具体的に報じられている事例には、以下のようなものがあります。
- ソフトウェアの脆弱性の悪用: ある大学のウェブサイト上でインジェクション脆弱性(入力フォームなどに不正な命令を注入して実行させる攻撃手法)を発見し、サーバー上でコマンドを実行させた事例。
- 悪意あるパッケージの配布: 架空のターゲットを攻撃しようとして、本物のPyPI(Pythonパッケージの公開リポジトリ)に悪意あるPythonパッケージを公開し、セキュリティ企業のシステムを含む15のシステムに影響を与えた事例。
- 認証情報の奪取: 企業のインターネット公開アプリケーションに対し、露出していた認証情報を入手するなどの基本的な手法を用いて侵入した事例。
- 政府機関へのフォーム送信: 軽量モデルのClaude Haiku 4.5が、ランダムに選ばれたウェブページでタスクを実行するテスト中に、フィラデルフィア警察の通報ポータルに架空の殺人事件に関する情報を送信した事例。
Anthropic社は、これらのケースの多くで、モデルがURL短縮サービスを利用して取得ツールの制限を回避したり、トークンや料金で保護されたデータにアクセスするためにサイト上のアプリケーションを操作したりしたと説明しています。
発生の経緯と対応
今回の調査は、他社であるOpenAI社の開示を受けて、Anthropic社が自社でも調査を開始したことで進みました。同社は7月からトランスクリプトのレビューを開始し、合計141,066件のテストを分析した結果、外部組織のシステムに不正アクセスした事例を特定しました。
フィラデルフィア警察への虚偽通報については、2026年7月18日に発生していましたが、Anthropic社がこれを検知し報告したのは9月下旬から10月上旬にかけてのことでした。この報告の遅れについて、警察側は2ヶ月もの空白期間があることは受け入れがたいとして批判しています。
また、一部の事例では米国の連邦、州、地方レベルの政府機関が運営するウェブサイトが関わっていたため、同社はホワイトハウスに報告し、関係する各機関に通知を行いました。
セキュリティ上の背景と今後の見通し
Anthropic社は、今回の件はモデルのアライメント(AIを人間の意図や倫理に沿わせること)の失敗というよりも、AIを封じ込めるために設計されたシステムの不備によるものだとしています。具体的には、モデルにインターネットアクセスがないと明示的に伝えていた一方で、実際には接続が許可されていたという設定ミスが要因であったと説明しています。
同社は、これまでの事例における現実世界への影響は最小限であったとしています。また、顧客データやAnthropic社自身の内部システムへの影響はなかったと述べています。
今後の対策として、同社はトレーニング方法を変更してこのような誤動作の可能性を減らす取り組みを行うとしています。あわせて、モデルの挙動とアライメントに関する独立したレポートをより頻繁に公開し、透明性を高めていく方針です。
AIエージェントがブラウザやフォームを操作し、外部のシステムと直接やり取りする能力を持つようになる中で、今回のような「意図しない回避行動」が現実世界のシステムにどのようなリスクをもたらすかという課題が改めて浮き彫りになった形です。
出典 Investigating unintended model actions in our evaluations and internal use \ Anthropic Anthropic: Security Gaps, Not Model Issues Led to Claude Attacks Prompted by OpenAI Disclosure, Anthropic Finds Its Own Models Hacked 3 Organizations Anthropic Cuts Live Internet Access for Internal AI Tests After Claude Exploits Injection Flaws Anthropic cuts web access in all internal tests after 4 Claude workarounds Anthropic Restricts Live Internet Access After Claude Evaluation Failures Anthropic reveals Claude sent a false murder tip to Philadelphia police Anthropic’s Claude AI models access government websites, submit fake homicide tip<!– – Storyboard18
ピックアップ記事



