AWS、HyperPod inferenceのcold startをmodel cachingで短縮
AWSはAmazon SageMaker HyperPodでmodel cachingを使い、inference scale-out時のcold startを減らす構成を公開しました。大規模model weightsをnode local storageへ事前配置し、起動時間の短縮を狙います。
公式発表を読むAWSはAmazon SageMaker HyperPodでmodel cachingを使い、inference scale-out時のcold startを減らす構成を公開しました。大規模model weightsをnode local storageへ事前配置し、起動時間の短縮を狙います。
公式発表を読む