← バックナンバーINFRASTRUCTURENVIDIA
NVIDIA、AI factories向けobservability設計を解説
NVIDIAは、AI factoriesのfull-stack observabilityを選ぶ実務フレームワークを公開しました。compute、networking、storage、orchestration、application layersをまたぐtelemetryを整理し、DCGM、NVSM、UFM、NetQ、NMX、BCM、Run:ai、NIMの役割をfailure domainsに対応付けています。
公式発表を読む