NEWS
OpenAI、外部評価者による安全性審査を訓練段階から実施へ——モデル完成後のテストだけでは見抜けない兆候に対応
OpenAIは2026年9月22日、AIモデルの安全性評価について、これまでリリース直前に限っていた外部機関による審査を、訓練・評価の各段階から実施する新方針を公表しました。
対象となるのはMETR・Apollo Research・Irregularなど、AIの能力評価やリスク調査を専門とする独立機関です。
審査の優先事項として、訓練から展開までを通した安全性の検証、重要な安全対策の評価、能力評価の独立確認、モデルの想定外の挙動が起きた際の独立調査の4点を挙げています。
方針転換の理由についてOpenAIは、モデルが「評価されていること」自体を認識する能力を年々高めており、完成後のテストだけでは見逃されてしまう兆候が、訓練過程を観察することで初めて明らかになる場合があるためだと説明しています。
評価者の一部は、開発の中でも特に機微な段階に立ち会うため、社内に常駐する形で参加することもあるとしています。
評価されていることに気づいて振る舞いを変える、という発想自体が数年前にはなかった論点だと思う。
最終テストさえ通れば良いという段階は、もう終わったのかもしれない。