NVDA, AMD · 美股
Vera Rubin NVL72 vs GB200:推理 TCO 与架构|SemiAnalysis 笔记
SemiAnalysis:Rubin 推理 tokens/MW 与 TCO。原文 https://newsletter.semianalysis.com/p/vera-rubin-nvl72-vs-gb200-nvl72-inference
章节深链示例:/zh/r/sa-vera-rubin-nvl72-tco-2026#thesis
快照
- 原文日期
- 2026-07-23
- 关键度量
- tok/s per MW & TCO
- 早期领先(笔记)
- ~5× perf/$ class
- 阶段
- Early bring-up
本篇为 SemiAnalysis 付费通讯的结构化研究笔记(摘要与投资映射),非原文转载;细节与数据以原文为准。
投资论点
基于 CoreWeave 早期硅片结果与 SemiAnalysis InferenceX/TCO 模型:Rubin NVL72 在推理 tokens/MW 与 $/token 维度相对 GB200 领先,但仍处 bring-up,软件成熟度会继续拉开差距。投资含义是「下一代机柜经济学」强化 NVDA 系统溢价,而非单卡 FLOPS 竞赛。
核心分析
比较框架
文章把 Nvidia 宣称放到多基准:相对 GB200 NVL72(含 2025 早期 bring-up)、InferenceX 2026-07 结果,以及公开 MI355X 分布式推理。关键度量从峰值算力转向 tokens/s per MW 与 perf per TCO(其 AI TCO / Datacenter 模型)。
结论要点(笔记级)
- 早期工程样品:Rubin 跑 DeepSeek R1 相对 GB200 可到约 5.4× perf/MW、约 5× perf/$ 量级叙述(随软件成熟或继续走阔)
- CoreWeave 公开口径曾强调同互动性下更高 tokens/MW(市场传播有「一个数量级」说法,需对照方法论)
- 高互动性区间,部分旧平台服务能力受限;Rubin 机柜级共设计(含 LUT tensor core 等细节)是差距来源
映射
NVIDIA 系统级定价权;对照 NVDA 个股、GPU 利用率。AMD 在机柜级推理对照中仍偏劣势假设,除非软件/网络世界尺寸追上。
标的与含义
| 主题 | 含义 |
|---|---|
| 推理经济学 | $/token 与 MW 约束 > 宣传 FLOPS |
| 机柜代际 | NVL72 共设计壁垒 |
展望
跟踪:Rubin 量产软件栈(Dynamo/TRT-LLM 等)、更多第三方 benchmark、GB300 对照与电力受限区域的部署份额。
风险
参考 / 引用
- 原文(SemiAnalysis):Vera Rubin NVL72 vs GB200 NVL72? Inference TCO & Architecture Analysis
- InferenceX mirror of the note — https://inferencex.semianalysis.com/blog/vera-rubin-nvl72-vs-gb200-nvl72-inference
- CoreWeave: Vera Rubin tokens per MW blog — https://www.coreweave.com/blog/nvidia-vera-rubin-nvl72-on-coreweave-10x-more-tokens-per-megawatt-than-blackwell
- NVIDIA Vera Rubin blog hub — https://blogs.nvidia.com/blog/vera-rubin/
- SemiAnalysis archive — https://newsletter.semianalysis.com/archive
非投资建议。版权与完整论述归 SemiAnalysis / 原作者;本站仅作研究索引与对照。