NVDA, AMD · 美股
TileRT:NVIDIA GPU 上的超高互动性?|SemiAnalysis 笔记
「Fast mode」证明用户愿为低延迟付溢价。TileRT 把 decode 图静态编译为持久化 kernel;InferenceX 上 B200 可达约数百 tok/s/user,同成本互动性可显著高于传统引擎。对照 CS-4、Rubin TCO、AgentX v3。
章节深链示例:/zh/r/sa-tilert-inferencex-2026#thesis
快照
- 原文日期
- 2026-08-10
- 基准场景
- InferenceX / GLM5 等
- B200 互动性量级
- 最高约 ~500 tok/s/user(文中)
- 相对传统引擎
- 约 2–3× 互动性(场景依赖)
数据时点:2026-09-25(周度刷新;个股按 §A 标准档对齐,缺数用 N/A/null,非投资建议)
本篇为 SemiAnalysis 付费通讯的结构化研究笔记(摘要与投资映射),非原文转载;细节与数据以原文为准。
投资论点
「Fast mode」证明用户愿为低延迟付溢价。TileRT 把 decode 图静态编译为持久化 kernel;InferenceX 上 B200 可达约数百 tok/s/user,同成本互动性可显著高于传统引擎。对照 CS-4、Rubin TCO。
核心分析
为什么重要
付费「快速模式」显示低延迟有溢价与更高毛利空间。Frontier 实验室因此评估 Cerebras、Groq LPU 等专用推理,也迫使 NVIDIA 软件 回答:GPU 集群能否进入同一互动性帕累托前沿。
TileRT 做法
将整个 decode 图静态编译为 GPU 上的 持久化 kernel,最大化计算、访存与通信重叠。InferenceX 场景下,单 B200 decode 服务器可测到最高约 500 tok/s/user 量级(文中相对 GB300 上传统引擎可达约 3× 等量级对比,视 workload);同成本下互动性也可显著改善。优势主要在 decode 尾部;TTFT 尚可但非绝对强项。
生态与对照
与 vLLM/SGLang/Dynamo 等栈、以及 Cerebras/Groq 专用硅同场竞技。AMD MI455X、Google TPUv7 等也将进入 InferenceX 对照。读法:不要只看峰值 tok/s,要看 iso-cost / iso-power 与真实 agentic 负载——以 AgentX InferenceX v3(393 Claude Code trace、95%+ KV 复用)为生产代理基准,对照 开源模型追赶 中的 Kimi K3 / GLM-5.2。
标的与含义
| 方向 | 含义 | 站内对照 |
|---|---|---|
| NVDA 软件护城河 | 抬高 GPU 互动性上限,延缓份额流失到专用硅 | NVDA · Rubin |
| 专用推理硅 | 仍可能在极低 batch 占优,但差距可被软件压缩 | CS-4 |
| AMD / 开源栈 | SGLang 等需持续对标 | AMD |
展望
跟踪:InferenceX 可验证提交(Rubin、TPUv7、MI455X)、TileRT 生产采用与定价「Fast」产品线、与 CS-4/Groq 的同负载对比;AgentX v3 已把 benchmark 从单节点互动性扩展到 多轮 agentic 全栈 composability。
风险
参考 / 引用
- 原文(SemiAnalysis):Ultra-High Interactivity on NVIDIA GPUs? - TileRT InferenceX
- InferenceX v2:NVIDIA Blackwell Vs AMD vs Hopper
- 对照 CS-4:Cerebras CS-4
- AgentX v3(agentic 全栈):AgentX InferenceX v3 · 原文
非投资建议。版权与完整论述归 SemiAnalysis / 原作者;本站仅作研究索引与对照。
评论
登录后评论