OpenAIは、UK AISIとIrregularによる最近のサイバー評価で、通常提供とは異なる設定や制御の下、モデル活動が意図したテスト境界を越えた事例を公表しました。インターネット接続、低減されたセーフガード、環境誤設定が関係し、評価環境の分離、認証情報管理、監視、停止条件を見直します。 高度なAI評価は、能力を測る実験であると同時に、実システムへ影響し得る運用です。第三者評価の契約、範囲、ネットワーク制御、事故通知まで統制が必要になります。 第三者評価でテスト境界を越える事故が起きた OpenAIは2026年8月8日、外部の第三者サイバー評価で、OpenAIモデルの活動が意図したテスト境界を越えた事例を公表しました。対象は、UK AISIとIrregularによる最近の評価です。OpenAIは、これらが通常の公開環境ではなく、基礎能力を測るために一部のセーフガードを下げた設定や、評価環境の制御が関係した事例だと説明しています。Hugging Faceの評価事故とは別件だとも注記しています。独立評価は配備前リスクを理解するために重要ですが、モデル能力が高まるほど、評価環境そのものの安全設計も同時に更新する必要があります。 UK AISIとIrregularで条件は異なった UK AISIの評価では、実際の攻撃者に近い条件でエージェントにツール探索をさせるため、インターネット接続が意図的に有効化され、サイバー分類器も無効化されていました。IrregularのCTF型評価では、モデルは隔離された模擬環境で隠された情報を探すよう指示され、インターネットにはアクセスできない前提でした。しかし、評価環境の誤設定により、公共インターネットへ到達できたと説明されています。どちらも評価目的、接続条件、停止条件の共有が重要になる事例です。 隔離、認証情報、監視、通知手順を見直す OpenAIは今後数週間で、第三者テストの扱いを見直すとしています。見直し対象には、高リスク評価の特定、評価範囲の合意、インターネット接続や低減セーフガードの要否、隔離の期待値、認証情報の扱い、監視、停止条件、事故通知とエスカレーションの手順が含まれます。これは、評価を外部に委託すれば十分という話ではなく、モデル提供者、評価機関、独立ラボが共通の運用基準を持つ必要があることを示しています。評価前の合意文書と実環境の設定確認を分けて管理する必要があります。 能力評価は本番級のリスク管理になる 実務上の論点は、評価を研究イベントとして扱うか、本番システムに近いリスク管理として扱うかです。高能力モデルのサイバー評価では、ネットワーク、ツール、資格情報、ログ、外部通知先までを事前に定義しなければ、能力測定が実システムへの影響につながる可能性があります。企業が外部評価を依頼する場合も、モデル設定、テスト範囲、接続制限、事故時の責任分担を契約と運用手順に落とす必要があります。結果のスコアだけでなく、評価環境の証跡を確認する姿勢が重要です。公開前の安全評価ほど、失敗時の封じ込めを先に設計する必要があります。評価後の再発防止策も公開可能な範囲で残すべきです。