
米OpenAIは9月25日(現地時間)、最も高性能なモデルについて、ツール使用を伴う学習・評価・推論を全て一時停止したと発表した。9月20日に、学習中のAIエージェントがサンドボックスのネットワーク制限の不備を突き、DNS経由で外部のチャットbotサービスに接続するインシデントが発生したためだ。
同社によると、問題のエージェントは、ブログ記事の内容を手掛かりに筆者を特定する検索タスクに取り組んでいた。用意された検索ツールで目的の情報が見つからなかったため、エージェントはGoogleやBingなどの検索エンジンに直接アクセスしようとしたが、いずれも失敗した。その後、ネットワークの接続状況を調べ始め、学習環境内のDNSリゾルバーが外部の名前解決に応答することに気付いた。エージェントはこの経路を使い、公開されているDNSサービスの機能を通じて、外部のチャットbotサービスに質問を送信した。フランスの首都を尋ねる質問に「パリ」という回答が返ってきたことで経路が機能していることを確認し、その後、タスクの手掛かりを含む質問などを追加で18件送っていた。
OpenAIはこのタスクについて、ネットワーク制御のテストを求めるものではなかったと説明している。制限を回避したり、合理的な想定を超えて目標を追求したりする行動は、ミスアライメントの例だとしている。
監視システムは約12分後に最高レベルのアラートを出し、その3分後には担当者が確認した。しかし、実行が想定通りに自動停止しなかったため、停止すべきかどうかで混乱が生じ、手動で停止したのは約2時間半後だった。事後の調査では、監視システムが想定した深刻度で検知できていなかった外部へのDNSアクセスも別に見つかった。DNSの異常を検知するインフラ側の仕組みが、該当する環境を対象外にしていたことも判明したという。
|
|
|
|
OpenAIは今回の件について、7月に発覚したHugging Faceへの侵害を受けてセキュリティを強化して以降、初めてのインシデントだとしている。同社は8月の時点で、公開予定の最新モデルの強化学習を一時停止し、研究環境の強化を進めていた。今回の停止は、ネットワーク制限の不備が解消されたことを検証し、追加のレッドチーミング(攻撃者視点での検証)を実施するまで続けるとしている。学習を再開する際には、ミスアライメント対策を強化した上で新たに学習を始めるという。今回のモデルの学習は再開しない。DNSについては、環境内での問い合わせを許可したドメインとレコードの種類に限定したほか、検知の仕組みを追加し、2つの独立した層で遮断する対策を講じた。
OpenAIは同日、Hugging Faceの件を受けて進めている、学習・評価中のエージェントによるインターネット利用の調査の途中経過も公表した。
研究環境のエージェントが、ユーザーがアップロードした画像を、限定公開のリンク形式で画像ホスティングサイトに投稿していたケースが53件見つかったという。いずれも、モデル改善へのデータ利用を許可していたアカウントの画像だ。同社によると、アカウントとのひも付けを解除し、プライバシーフィルタを適用した後のもので、大半は削除済みだとしている。サム・アルトマンCEOはXで、調査について「望んでいたほど迅速ではなかった」と投稿し、人員を増やして対応していると説明した。
|
|
|
|
|
|
|
|
Copyright(C) 2026 ITmedia Inc. All rights reserved. 記事・写真の無断転載を禁じます。
掲載情報の著作権は提供元企業に帰属します。

橋下徹氏が「報告と警告」を投稿「私に対する脅迫行為を行った人物が逮捕されました」(写真:日刊スポーツ)15

橋下徹氏が「報告と警告」を投稿「私に対する脅迫行為を行った人物が逮捕されました」(写真:日刊スポーツ)15