NVDA, AMD, AMZN · 美股

Cerebras CS-4:同晶圆加倍频与解耦推理机架|SemiAnalysis 笔记

CS-4 仍用 5nm WSE-3,靠功耗/时钟与三晶圆「背包」机架把单晶圆 tokens/s/user 约翻倍、BOM/晶圆成本接近上代;44GB SRAM 容量不变,长上下文靠解耦与 HBM 搭档。对照 TileRT、AgentX v3、AMZN/Trainium。

发布 更新 打开交互阅读器

下载 Markdown导出 PDF

章节深链示例:/zh/r/sa-cerebras-cs4-2026#thesis

快照

原文日期
2026-08-19
晶圆/制程
WSE-3 / 5nm
机架晶圆数
3(CS-3 为 2)
单架 TDP 约
125–135 kW
数据截至 2026-09-25

数据时点:2026-09-25(周度刷新;个股按 §A 标准档对齐,缺数用 N/A/null,非投资建议)

本篇为 SemiAnalysis 付费通讯的结构化研究笔记(摘要与投资映射),非原文转载;细节与数据以原文为准。

投资论点

CS-4 仍用 5nm WSE-3,靠功耗/时钟与三晶圆「背包」机架把单晶圆 tokens/s/user 约翻倍、BOM/晶圆成本接近上代;44GB SRAM 容量不变,长上下文靠解耦与 HBM 搭档。对照 TileRT、AMZN/Trainium。

核心分析

硬件:同晶圆、加倍频

SemiAnalysis:CS-4 第四代机架仍围绕 WSE-3(5nm),通过更高功耗与时钟、更好供电/散热,使单晶圆 tokens/s/user 约翻倍,峰值 FLOPs 与片外 I/O(约 1.2→2.4 Tb/s)同步抬升;片上 SRAM 仍约 44GB(由 bitcell 决定),容量要等下一代硅。

机架:「背包」三晶圆

机架拆成前半供电、后半算力;每个 backpack 一颗晶圆,一架三颗(CS-3 为两颗)。冷却泵/换热器外置适配液冷机房。部署可先上电再现场插入 backpack,制造与上架更快。单架约 125–135 kW(较 CS-3 单晶圆功耗量级显著上抬);性能/瓦最多微升,成本/晶圆或接近上代——对客户是「近似同 TCO、近双倍互动性」。

网络与解耦

新 I/O 模块(可现场升级)把专有 I/O 转标准以太网,利于与 AMD / AWS Trainium 等做 PDD / AFD 解耦:Cerebras 偏 decode,HBM 系统补容量。直连晶圆延迟可压到约 2µs,但相对竞品纳米秒级交换仍属「相对超快」;专家并行跨晶圆仍难,默认仍偏流水线并行。

与 GPU 互动性叙事

公司口径可达「相对 GPU 最高约 30×」互动性;SA 粗估 CS-4 约 ~4k tok/s/user vs CS-3 ~2k,Blackwell 现实并发约百量级 tok/s/user。真正对标要看 TileRT 把 GPU 推到高互动区后的差距,以及 AgentX v3 在 多轮 agentic 负载下 multi-GPU composability 是否仍 favor GPU 软件栈。长上下文(百万级)在高并发下可能需要数十套系统级 CAPEX。

标的与含义

方向 含义 站内对照
Cerebras / 超快推理层 互动性溢价与解耦 decode 角色 私有公司;映射 NVDA 软件反击
NVIDIA GPU 软件 TileRT 等抬高 GPU 互动性上限 TileRT · NVDA
AWS / Trainium 异质解耦与 EFA 叙事 AMZN
AMD 解耦搭档之一 AMD · CUDA moat

展望

跟踪:Hot Chips 细节、CS-4 出货与 AWS/OpenAI 类部署、与 TileRT/Groq 的互动性对标、Nexus/CS-5 路线(约每年 2×、2027 吞吐目标量级)。

风险

参考 / 引用

  1. 原文(SemiAnalysis):Cerebras's Next Generation CS-4: Fast Just Got Faster
  2. Cerebras 官方 CS-4 发布:Introducing Cerebras CS-4
  3. 对照 TileRT:Ultra-High Interactivity on NVIDIA GPUs? - TileRT InferenceX
  4. AgentX v3(agentic 全栈):AgentX InferenceX v3 · 开源模型追赶

非投资建议。版权与完整论述归 SemiAnalysis / 原作者;本站仅作研究索引与对照。

免责声明:本文仅为研究信息,不构成任何投资建议或买卖推荐。

评论

登录后评论

加载中…