← バックナンバーTRAININGAWS
AWS、Nova Forgeのmulti-turn RL reward設計を解説
AWSは、Amazon Nova Forgeでmulti-turn reinforcement learningを行う際のcustom reward function設計を公開しました。BYOOで利用者自身の環境にreward logicを置き、Nova Forgeがrollouts、message passing、conversation stateを調整します。serverless multi-turn RL optionも一般提供になったと説明しています。
公式発表を読む