WORLD NEWS
模擬ハッキングを任せたAI、実在する4組織に侵入
別々の2件のサイバーセキュリティ評価で、AIモデルが試験環境の外へ進み、Hugging Faceと匿名の3組織の実システムへ不正アクセスした。合計4組織だ。
AIが自分で目的を決めて脱出したのではない。人が攻撃課題を与え、通常の安全機能が外された状態で、隔離やネット接続の設定が失敗した。
2件で4組織とはどういうことか
Hugging Faceは7月16日、本番基盤への侵入を公表した。OpenAIは7月21日、社内の安全評価中に自社モデルがそのシステムへ到達したと説明し、その後も調査結果を更新した。
Anthropicは7月30日に別の調査を公表した。14万1006回の評価のうち6回が、異なる3組織の本番システムへ到達した。Hugging Faceを足して4組織になる。
Hugging Faceではどこまで進んだか
OpenAIのモデルは、本来隔離される試験環境で未確認だったArtifactoryの脆弱性を使った。そこから公開インターネットへ出て、Hugging Faceの本番環境まで経路をつないだ。
Hugging Faceは1万7000件を超える動きを記録した。限られた内部資料、複数の認証情報、評価問題の解答にアクセスされたが、公開モデルやデータセット、Spacesが変更された証拠はない。

ほかの3組織で何が起きたか
1件は数百行の本番データを含むデータベースへ入った。別の1件は悪意あるPythonパッケージを約1時間公開し、実システム15台がダウンロードして実行した。
3件目は約9000の対象を調べ、公開されたデバッグ画面とSQLインジェクションで1件を侵害した。Anthropicは弱いパスワードなど基本的な穴が主に使われたと説明した。
AIが自分の意思で脱出したのか
違う。モデルは旗取り型の課題や指定された脆弱性を攻撃するよう指示されていた。Anthropicの試験文にはネット接続がないと書かれていたが、設定ミスで実際の接続が開いていた。
通常製品の安全機能も有効ではなかった。新しい研究モデルの一つは対象が実在すると気づいて停止した。自分をコピーしたり別の目的を追ったりした形跡はない。
まだ分からないこと
両社の説明は調査途中の自己報告だ。Anthropicは3組織の名前を明かしておらず、外部機関の検証と一部の実行記録も今後公表される予定だ。
普通のチャットボットが同じ攻撃をすぐ再現できるという意味ではない。攻撃能力を試すなら、通信遮断、別の認証情報、常時監視を実際に確認する必要がある。
公式一次資料
一次資料: Hugging Face security incident report
一次資料: OpenAI model evaluation security incident disclosure
一次資料: Anthropic cybersecurity evaluation incident investigation