GPT-Red、自動レッドチーミングでGPT-5.6の堅牢性を強化
OpenAIは、プロンプトインジェクションなどの脆弱性を自動探索する内部レッドチーミングモデルGPT-Redを発表。自己対戦型RLで攻撃を生成し、GPT-5.6の訓練に組み込むことで、最難関の直接プロンプトインジェクション評価で失敗を大幅に減らしたと説明しています。
公式発表を読むOpenAIは、プロンプトインジェクションなどの脆弱性を自動探索する内部レッドチーミングモデルGPT-Redを発表。自己対戦型RLで攻撃を生成し、GPT-5.6の訓練に組み込むことで、最難関の直接プロンプトインジェクション評価で失敗を大幅に減らしたと説明しています。
公式発表を読む