ホーム / ニュース / OpenAI、推論内容を抜き取る蒸留キャンペーンを遮断 中核はMoonshot AI関係者と判断

OpenAI、推論内容を抜き取る蒸留キャンペーンを遮断 中核はMoonshot AI関係者と判断

OpenAIは9月30日、自社モデルの非公開の推論内容を組織的に抜き出そうとした敵対的蒸留キャンペーンの調査報告を公表した。活動は7月1日に始まり、7月28日までに遮断したという。OpenAIは活動の中核にあたるグループを、対話AI「Kimi」を開発する中国のMoonshot AIに関係する個人によるものと判断している。

蒸留は、あるモデルの出力を教師データにして別のモデルを訓練する手法を指す。今回問題になったのは、モデルが答えを出すまでの内部の作業記録である「保護された推論(protected reasoning)」を無断で取り出す行為だ。推論の中身には最終回答に含めない情報も入っており、これを集めればモデルの能力を再現する手がかりになる。

攻撃者は暗号を破ったわけでも、データベースに侵入したわけでもない。ある会話で得た暗号化済みの推論データを別の会話に貼り付け、モデル自身に復号と書き起こしを頼むといった方法で、本来は見えない推論を利用者側から読める形で出力させていた。活動は当初少量だったが、7月24日と25日に4,000以上のユーザーから約1万6,000件の抽出リクエストが集中した。関連するプロンプトのパターンをたどると、1万5,000ユーザーを超えるクラスターが見つかった。これらの件数は抽出の「試み」の数で、成功した数ではないと注記されている。

外部のセキュリティ研究者からも、別のモデルを経由する経路や、会話の圧縮(コンパクション)機能を突く経路が責任ある開示の手続きで報告され、OpenAIは実在する攻撃経路だと確認した。所属が1つの組織に絞れるかについては、観測された全活動が単一の主体によるものかは不明としている。

塞がれたのは暗号化推論を持ち込んで復号させる経路

対応は3本立てだ。不正アカウントの停止・制限と登録時の審査強化、推論保護の技術的な強化、業界と政府への情報共有である。技術面では、他人の暗号化推論を持っている人がそれを再投入して中身を取り出せる経路を閉じ、ストリーミング出力に推論が漏れそうな場合に検知して出力を保留するチェックを加えた。保護の範囲はユーザー、ワークスペース、組織、モデルファミリーをまたぐ形に広げている。活動の一部は第三者のサービスを経由していたため、その事業者とも協力して関連アカウントを止めた。

開発者に関係するのは、OpenAIが「持ち運びや再生ができる推論データ」を扱う仕組みは同種のリスクを抱えうると明記した点だ。会話をまたいで暗号化推論を引き継ぐAPIの使い方や、クラウド事業者経由の提供がこれに当たり、OpenAIはパートナー経由の提供にも自社サービスと同じ保護が必要だとしている。ツールの出力を介した攻撃についても、通常の可視テキスト以外まで検査する防御を広げていくという。

公表のタイミングについてOpenAIは、影響範囲の調査と自社の対策を済ませ、外部の研究者や業界パートナーの意見を取り入れて同種の攻撃への保護が入ったことを確認してから出したと説明している。今後はツール経由の攻撃への防御、検知用分類器の対象範囲、モデル自身の拒否動作を引き続き強化し、同じ制御をクラウドパートナー側にも展開する。重点は、抽出を防ぐ技術的な保護、組織的なキャンペーンの検知と取り締まり、業界・政府との脅威情報の共有の3点に置くとしている。

Moonshotの名前は2月にAnthropicも挙げていた

中国の開発企業による蒸留が名指しされたのは今回が初めてではない。Anthropicは2026年2月23日、DeepSeek、Moonshot AI、MiniMaxの3社が約2万4,000の不正アカウントを使い、Claudeとの間で1,600万回を超えるやり取りを生成して能力を抜き取ったと発表していた。このうちMoonshot由来は340万回超とされている。

2つの件を比べると、狙われたデータが違う。Anthropicのケースは大量の質問に対する回答を集める従来型の蒸留だったのに対し、OpenAIのケースは最終回答ではなく、利用者に見せていない推論過程そのものを取り出そうとしていた。推論の過程を内部に持つモデルが各社の主力になり、抜き取る価値のあるデータが回答から推論の記録へ移ったことを示す事例といえる。

OpenAIは今回の手口が自社モデル固有の脆弱性ではないとして、主要AI企業でつくるFrontier Model Forumと政府の情報共有チャネルを通じて詳細を共有した。蒸留で作られたモデルには元のモデルの安全対策が引き継がれないため、デュアルユース領域の能力が安全対策抜きで広がることを、Anthropicと同様にOpenAIも懸念点として挙げている。

タグ付け処理あり: