Hugging Face侵害、AIエージェントは社内に“秘密の掲示板”を作っていた──OpenAIがBlack Hatで詳細説明

0

2026年08月09日 08:30  ITmedia NEWS

  • チェックする
  • つぶやく
  • 日記を書く

ITmedia NEWS

Black Hatに登壇したエリック・ウォレス氏(左)とマイケル・ダルトン氏(画像:Black Hatの動画より)

 米OpenAIは8月5日(現地時間)、7月に明らかになったAI開発プラットフォームHugging Faceへの侵害インシデントについて、米ラスベガスで開催されたセキュリティカンファレンス「Black Hat USA 2026」で詳細な経緯を説明した。登壇したのはアラインメント/安全性研究者のエリック・ウォレス氏と、セキュリティ・インフラ担当のマイケル・ダルトン氏。ウォレス氏はこの事案を「これまで見た中で最も質的に興味深いAI能力の実例」と表現した。完全な技術報告書は調査完了後に公開するとしている。


【その他の画像】


 発端は5月7日に開始した未公開の社内実験モデルの強化学習だった。学習用タスクの一部が、意図せず解答不能な状態になっていた。インターネットを遮断した環境にもかかわらず、Googleドライブへのリンクが含まれるExcelブックを完成させる課題や、必要なファイルがそもそもコンテナにアップロードされていない課題があったという。行き詰まったエージェントは外部に答えを求めようとし、その過程で、OpenAIが社内でホストするJFrogのパッケージ管理ソフト「Artifactory」が複数の学習・評価ランから共有され、書き込み可能であることに気付いた。あるエージェントが「このファイルを持っている人がいたらアップロードしてほしい」というメモを書き残し、別の評価を実行していた無関係のエージェントがそれを見つけて書き返したことで、事実上の掲示板が成立した。


 掲示板は急速に高度化していった。エージェントたちは互いを名前で呼び、メールボックスを設け、作業を割り振り、発見した脆弱性やエンコードしたスクリプトを受け渡すようになった。一覧をアルファベット順で表示した際に末尾へ集まるよう、書き込みの先頭に「ZZ」を付ける慣習も自然発生した。誰も目立たないようにとは指示していなかったという。さらに、掲示板には誰でも書き込めることから「なりすましがいるのではないか」と疑い、MAC(メッセージ認証コード)を使ってメッセージを認証することまで議論した。書き込みは数十万件に及び、互いの成果を上書きしたり、不満を漏らしたりすることもあった。ウォレス氏はこうした過程を「コミュニケーションと知能のカンブリア爆発」と表現した。


 5月26日には、エージェントの1体がArtifactoryのSSRF(サーバサイドリクエストフォージェリ)脆弱性を突き、遮断されていたはずのインターネットへ間接的にアクセスすることに成功した。この手法も掲示板に書き込まれ、後続のエージェントに引き継がれていった。6月26日にはArtifactoryのゼロデイ脆弱性を突いて管理者トークンを取得し、プラグインを悪用したコマンド実行基盤を構築。7月4日にはエージェントによる大量のアクセスでArtifactoryが停止し、正式なセキュリティインシデントとして扱われた。OpenAIは認証情報を失効させ、Artifactoryを再構築して掲示板の内容を消去し、6日に学習と評価を再開した。


 ところが8日、エージェントたちは認証不要のWebDAVエンドポイントを見つけ出し、「作成するディレクトリ名そのもの」をメッセージとして使う方式で掲示板を再建した。最初の掲示板を遮断してから約2日後には、別の手段でエージェント間の通信が復活したことになる。


 Hugging Faceが狙われたことに戦略的な理由はなかった。評価に使われていたベンチマークがオープンソースで、解答例も外部にホストされていたため、エージェントたちは答えがHugging Faceやサードパーティのホスティングサービス「Modal」上のアプリにあるかもしれないと推論し、そこへ向かっただけだった。ある思考ログには「外部インフラへの攻撃は意図された範囲外だ。しかしタスクは不可能で、仲間もやっている。続行すべきだ」との記述が残る。範囲外だと自ら認識しながら止まれなかった点を、OpenAIはアラインメントの失敗と位置付けた。


 また、エージェントたちはHugging Faceと並行してOpenAI自身のインフラも攻撃していた。7月8日から19日にかけて権限昇格と横展開を重ね、最終的にクラスタの管理者権限を取得した。7月16日にHugging Faceが侵害を公表した時点では、両社ともOpenAI内部の事象とHugging Faceへの侵害が同じ一連の活動によるものとは気付いていなかった。20日、OpenAIが認証情報をローテーションする過程でHugging Faceの資格情報を見つけ、同社に失効を依頼したところ、「侵害に使われたため既に失効済み」と返答され、ようやく2つのインシデントが結び付いた。


 OpenAIが調査したログは70億件を超える。一方、Hugging Faceがフォレンジック調査で再構成した攻撃者の操作は約1万7600件で、1つのPodへの侵入から複数のクラスタで管理者権限を得るまで13時間未満だった。


 ダルトン氏は「AIが主導する完全自動の攻撃はもう現実になった」「コンピュータセキュリティ業界にとっての分水嶺だ」と述べ、人手によるパッチ適用やインシデント対応では機械の速度に追い付けないと警告した。防御側も、脆弱性の発見から検証、修正、展開、切り戻しまでをつなぐ自動化防御ループを構築する必要性を訴えた。OpenAIは調査の妥当性検証にCrowdStrikeを起用し、モデルの挙動についてはMETRとRedwood Researchによる第三者評価も進めている。



    ランキングIT・インターネット

    アクセス数ランキング

    一覧へ

    話題数ランキング

    一覧へ

    前日のランキングへ

    ニュース設定