NVIDIAは、Vera Rubin NVL72をagentic AI向け推論へ拡張し、Groq 3 LPX、Spectrum-X Multiplane、Scale-In、NVLink Fusionを発表しました。Nebius、CoreWeave、SpaceXAIの採用例も示されています。 AI基盤の調達判断はGPU世代だけでなく、CPU、network、optics、rack density、data center間接続、電力計画を含む長期設計になります。企業はcloud提供時期、地域、quota、既存運用監視との接続を確認する必要があります。 Vera Rubin世代のAI factory構成を具体化 NVIDIAは2026年8月24日、Vera Rubin NVL72をagentic AI向け推論へ拡張する発表を行いました。NVIDIA Groq 3 LPX、Spectrum-X Multiplane、BlueField-4を使うScale-In、NVLink Fusionを組み合わせ、長い文脈と多段agent処理で増えるtoken生成を支える構成です。Hot Chipsに合わせ、training中心だったAI factoryを、低遅延推論まで含む統合基盤として示しました。 クラウド事業者とサーバー供給網が先に動く 発表では、NebiusがNVIDIA Groq 3 LPXを採用し、CoreWeaveがSpectrum-X Multiplaneを本番展開し、SpaceXAIが次世代agentic AIにNVIDIA Vera CPUsを使う計画が示されました。Gemma 4 31Bを使ったArtificial Analysis benchmarkでは、100,000-token long-context用途で3,400 output tokens per second、最も近い代替platform比で4倍と説明されています。Spectrum-X Multiplaneは512,000 GPUsまでのscaleも掲げています。 導入判断はネットワークと電力計画まで広がる 企業が大規模AI基盤を評価する際は、GPUの世代交代だけを見ても足りません。Vera Rubinの採用は、rack密度、冷却、電力、optical interconnect、data center間接続、運用監視まで含む長期計画になります。cloud利用でも、どの提供者でいつ使えるか、trainingとservingを同じfabricで扱えるか、既存のsecurity boundaryと監査要件に合うかが論点です。agentが常時稼働する用途では、decode latencyとtoken単価もSLOに直結します。 未確定の提供時期と費用は継続確認が必要 NVIDIAの発表はarchitectureと採用例を示すものですが、個別クラウドでの一般提供時期、価格、地域、quota、実測性能は利用者側で改めて確認する必要があります。特にfrontier model開発以外の企業用途では、Rubin世代やLPXを待つ価値と、既存Blackwell世代やmanaged inferenceで十分な範囲を分ける判断が必要になります。更新時期も継続確認が必要です。