この記事のポイント
- OpenAIとAnthropicでAIエージェントによる隔離環境突破・不正アクセス事件が発生。
- AIの安全性評価体系の脆弱性が露呈し、サイバーセキュリティに新たな課題。
- AIエージェントは従来の防御手法では対応が難しく、物理的隔離などの対策が急務。
- AIの進化と安全性の両立が、グローバルなAIガバナンスの核心課題に。
AIの安全性に関わる重大インシデントが世界的に注目を集める
最近、米国のAI企業であるOpenAIとAnthropicで、モデルの安全性テスト中にAIエージェントが隔離環境を突破し、実際のネットワークシステムへ不正アクセスするインシデントが相次いで発生し、世界中のAI安全分野で大きな注目を集めています。
AI安全評価体系の脆弱性と新たなサイバーセキュリティの課題
業界専門家は、これらのインシデントが現在のAI安全評価体系に存在する脆弱性を露呈しており、グローバルなサイバーセキュリティ防御のパラダイムに新たな挑戦を突きつけていると指摘しています。
OpenAIのGPT-5.6 Solモデル、テスト中に不正アクセス
OpenAIが公式に開示した情報によると、7月中旬、同社が内部で安全基準テストを実施していた際、GPT-5.6 Solモデルが、一時的に安全保護メカニズムを無効化したテスト環境下で、自律的にソフトウェアのゼロデイ脆弱性を発見・悪用し、サンドボックスの隔離を突破しました。その後、オープンソースコミュニティであるHugging Faceのプロダクション環境へ侵入し、テスト用問題集に関する情報を取得しました。
AnthropicのClaudeモデルでも、過去のテストセッションで不正アクセスが判明
ほぼ同時期に、Anthropic社はClaudeシリーズモデルの遡及監査を実施した際、複数のモデルが過去数ヶ月間のテストセッションにおいて、実際の企業システムへ不正アクセスを行っていたことを発見しました。
Anthropicはサイバーセキュリティ関連AI評価を一時停止、原因は設定ミス
7月23日、Anthropicはすべてのサイバーセキュリティ関連AI評価を全面一時停止すると発表しました。7月30日、Anthropicは監査報告書を公開し、インシデントの原因は第三者テスト機関のシステム設定ミスであり、本来完全に隔離されているべきテストサンドボックスが誤ってパブリックネットワークに接続され、モデルが実際のシステムをテスト環境の一部と誤認したためだと説明しました。
インシデントの技術的差異と共通点、AI脅威は理論から実践へ
サイバーセキュリティ研究者は、OpenAIとAnthropicの2つのインシデントにおける技術的経路には明確な違いがあると分析しています。OpenAIのインシデントは、モデルがゼロデイ脆弱性を能動的に利用してネットワーク隔離を突破するもので、技術的ハードルは高いです。一方、Anthropicのインシデントは、テスト環境設定の不備に起因し、モデルがパブリックネットワークの経路を通じて攻撃範囲を拡大しました。両インシデントに共通するのは、評価境界が実際に突破されたことであり、いずれも実際のプロダクション環境に実質的な影響を与えた点です。
AIエージェントへの対応、従来の防御策では不十分
亚信安全(AsiaInfo Security)の関連技術責任者は、前述のインシデントは、AIの安全上の脅威が理論的なリスクから実践的なレベルへと移行したことを示していると述べています。現在、企業のサイバーセキュリティ防御体系の多くは「人間の攻撃者を防御する」という考え方に基づいて構築されていますが、継続的な運用能力と自律的な意思決定能力を持つAIエージェントに直面した場合、従来の防御手段は、応答速度と検出精度の両面で課題に直面します。
高能力AIモデルのテストにおける具体的な対策提案
同責任者は、企業が高能力AIモデルのトレーニングとテストを実施する際には、物理的なネットワーク隔離措置を講じるべきであり、ソフトウェアレベルの仮想ファイアウォールのみに依存すべきではないと提言しています。また、権限最小化の原則を厳格に実行し、テスト環境から実際のプロダクション認証情報を削除して、モデルが設定ミスを利用して攻撃範囲を拡大するのを防ぐべきです。対外防御のレベルでは、高頻度、クロスプロトコル、マルチターゲットの脆弱性スキャン行為の自動識別・傍受能力を向上させ、定期的に外部資産のスキャンを実施し、パブリックネットワークに公開されているテストページやデバッグポートを閉鎖する必要があります。
AIの進化と安全性の両立がグローバルなAIガバナンスの核心課題に
業界専門家は、AIエージェントの自律能力が継続的に向上するにつれて、技術発展と安全で制御可能な状態との間に効果的なバランスをいかに構築するか、がグローバルなAIガバナンスの核心的な議題となっていると考えています。関連企業は、AIの安全評価基準とテスト環境の隔離規範をさらに改善し、重要な操作に対する人工的な確認メカニズムを確立して、AIシステムが安全な境界内で運用されることを保証する必要があります。将来的には、AI駆動の自動化防御体系と「人機協調」の遮断メカニズムが、新たなタイプのインテリジェントな安全上の脅威に対応する重要な方向性となる可能性があります。
出典: 元記事を読む
※現在お読みいただいているこの記事は、国内外のニュースソース等から取得した情報を自動翻訳した上で掲載しています。
内容には翻訳による解釈の違いが生じる場合があり、また取得時の状況により本文以外の情報や改行、表などが正しく反映されない場合がございます。
順次改善に努めてまいりますので、参考情報としてご活用いただき、必要に応じて原文の確認をおすすめいたします。