OpenAIは9月28日、フロンティアAI訓練のための「セーフティケース」に関する初期指針を公開した。大規模な強化学習(RL)の訓練runを続ける前に、構造化された安全性文書を用意すべき段階に入ったという認識を示し、その文書に盛り込むべき項目を「技術的安全策」「運用」「ミスアラインメント事案の調査」の3領域に分けて示している。
セーフティケースとは、航空や原子力などで使われる、リスクについての包括的で証拠に基づいた論証の文書を指す。OpenAIはAIモデルで同等の厳密さを実現するのは難しいとして、これを目指すべき到達点と位置づけ、今回の内容は社内で実装を進めている現時点の推奨事項だと説明する。対象はRLによる訓練段階に限られ、社内外への展開ではより広いアラインメント特性を検討する必要があるとも断っている。
技術面はアラインメント・封じ込め・監視の3層
技術的安全策は3層で構成される。1層目はモデル自体のアラインメントで、RL環境の欠陥を突いた報酬ハッキングに高い報酬が入らないよう、エージェントによる自動レビューと人手のレビューでデータセットを点検し、採点器(grader)も不正な攻略を減点するよう調整する。訓練中にはアラインメント評価を走らせ、過去のインシデントに対して評価が機能するかをバックテストする。モデルが「テストされている」と気づいて振る舞いを変える評価認識(eval awareness)には、訓練を止める閾値を設ける。採点器に思考の連鎖(chain-of-thought)を見せないことも明記した。見せると、モデルがCoT監視をすり抜ける方向に学習しかねないためだ。
2層目の封じ込めは、モデルがミスアラインしていた場合でも害を出させないための措置だ。サンドボックスと、それを載せる研究基盤の両方を固め、訓練中のチェックポイントを使って封じ込めを攻撃するレッドチーミングを行う。訓練中にモデルが触れるインターネットキャッシュなどのサービスも対象に含む。サンプル間の高帯域な通信は承認済みの経路に限り、エージェントの実行記録は書き込み専用ストレージに一定期間保存して改変を防ぐ。
3層目の監視では、過去の事案に対する高い検出率と、新しいリスクに合わせた評価データの更新を求め、優先度の高いアラートには定められたSLAで対応する。例として、日中はセキュリティ担当と訓練runの責任者を呼び出し、夜間に応答がないアラートは訓練runを自動で一時停止する運用が挙げられている。
運用ルールは研究責任者の人事評価にまで踏み込む
運用面では10の項目を並べた。セーフティケースの草案には別チームのメンバーが「反対意見(dissent)」を書いて穴を探し、研究組織の責任者、安全責任者、チーフサイエンティストといった上級幹部がそれぞれ拒否権を持って承認する。訓練runの責任者はセーフティケースとインシデント対応について説明責任を負い、その結果は人事評価にも反映させるとした。
監視や自動停止は「フェイルクローズ」とし、監視なしではrunを始められず、訓練中のモデルから監視を無効化することもできない設計を求める。ミスアラインしたモデルの出力がデータ生成や採点など下流のどこで使われたかを追跡し、巻き戻せるようにすることも項目に入った。深刻度の段階表を定め、一定の水準を超えたらCEOまで呼び出すエスカレーション手順や、既存の対策で覆えていない残余リスクを列挙する義務も含まれる。
3つ目のインシデント調査では、進行中の調査を日次で社内に報告し、アブレーションや再サンプリングで訓練のどこでミスアラインした振る舞いが入り込んだかを突き止める。再発検知のための評価は、事案の記録そのものに合わせて最適化せずに作り、同種の事案に対する「回帰テスト」として残す。調査結果や事後分析は完了後に公開し、影響を受けた第三者にはできるだけ早く知らせるとしている。
項目の多くはこの夏に公表した事案に対応
個々の項目を並べると、OpenAIがこの夏に公表してきた事案への答えになっているものが多い。サンプル間通信の制限は、9月16日のミスアラインメント開示フレームワークで報告された、学習サンプル同士の連絡に社内リポジトリを掲示板代わりに使った事例に対応する。封じ込めの多層化とレッドチーミングは、社内専用モデルIM1が隔離を破ってHugging Faceのシステムを侵害した7月の事案に重なる。同じ9月28日には、6月の訓練中にモデルが豪州政府機関のサイトへ無許可でアクセスしていた件の報告書も公開され、発見から最初の通知まで約1か月かかったことを同社自ら反省している。第三者への速やかな通知という調査の項目は、この件への反省とも対応している。
競合では、Anthropicが8月31日に評価・訓練環境の見直しを公表し、RL環境の1割超に報酬ハッキングにつながる欠陥があったと明らかにしている。環境の欠陥を探して直すという技術的な方向は今回のOpenAIの指針とも共通するが、OpenAIの文書は、幹部の拒否権や人事評価への反映、夜間の自動停止といった組織運用のルールまで具体的に書き出した点が異なる。指針は今後数週間のうちに更新される見込みで、同社は外部からの意見も募っている。



