NVDA, AMD · 美股

Vera Rubin NVL72 vs GB200:推理 TCO 与架构|SemiAnalysis 笔记

SemiAnalysis:Rubin 推理 tokens/MW 与 TCO。原文 https://newsletter.semianalysis.com/p/vera-rubin-nvl72-vs-gb200-nvl72-inference

发布 更新 打开交互阅读器

章节深链示例:/zh/r/sa-vera-rubin-nvl72-tco-2026#thesis

快照

原文日期
2026-07-23
关键度量
tok/s per MW & TCO
早期领先(笔记)
~5× perf/$ class
阶段
Early bring-up
数据截至 2026-08-03

本篇为 SemiAnalysis 付费通讯的结构化研究笔记(摘要与投资映射),非原文转载;细节与数据以原文为准。

投资论点

基于 CoreWeave 早期硅片结果与 SemiAnalysis InferenceX/TCO 模型:Rubin NVL72 在推理 tokens/MW 与 $/token 维度相对 GB200 领先,但仍处 bring-up,软件成熟度会继续拉开差距。投资含义是「下一代机柜经济学」强化 NVDA 系统溢价,而非单卡 FLOPS 竞赛。

核心分析

比较框架

文章把 Nvidia 宣称放到多基准:相对 GB200 NVL72(含 2025 早期 bring-up)、InferenceX 2026-07 结果,以及公开 MI355X 分布式推理。关键度量从峰值算力转向 tokens/s per MWperf per TCO(其 AI TCO / Datacenter 模型)。

结论要点(笔记级)

  • 早期工程样品:Rubin 跑 DeepSeek R1 相对 GB200 可到约 5.4× perf/MW、约 5× perf/$ 量级叙述(随软件成熟或继续走阔)
  • CoreWeave 公开口径曾强调同互动性下更高 tokens/MW(市场传播有「一个数量级」说法,需对照方法论)
  • 高互动性区间,部分旧平台服务能力受限;Rubin 机柜级共设计(含 LUT tensor core 等细节)是差距来源

映射

NVIDIA 系统级定价权;对照 NVDA 个股GPU 利用率AMD 在机柜级推理对照中仍偏劣势假设,除非软件/网络世界尺寸追上。

标的与含义

主题 含义
推理经济学 $/token 与 MW 约束 > 宣传 FLOPS
机柜代际 NVL72 共设计壁垒

展望

跟踪:Rubin 量产软件栈(Dynamo/TRT-LLM 等)、更多第三方 benchmark、GB300 对照与电力受限区域的部署份额。

风险

参考 / 引用

  1. 原文(SemiAnalysis)Vera Rubin NVL72 vs GB200 NVL72? Inference TCO & Architecture Analysis
  2. InferenceX mirror of the note — https://inferencex.semianalysis.com/blog/vera-rubin-nvl72-vs-gb200-nvl72-inference
  3. CoreWeave: Vera Rubin tokens per MW blog — https://www.coreweave.com/blog/nvidia-vera-rubin-nvl72-on-coreweave-10x-more-tokens-per-megawatt-than-blackwell
  4. NVIDIA Vera Rubin blog hub — https://blogs.nvidia.com/blog/vera-rubin/
  5. SemiAnalysis archive — https://newsletter.semianalysis.com/archive

非投资建议。版权与完整论述归 SemiAnalysis / 原作者;本站仅作研究索引与对照。