NVDA, AMD, AMZN · 美股
Cerebras CS-4:同晶圆加倍频与解耦推理机架|SemiAnalysis 笔记
CS-4 仍用 5nm WSE-3,靠功耗/时钟与三晶圆「背包」机架把单晶圆 tokens/s/user 约翻倍、BOM/晶圆成本接近上代;44GB SRAM 容量不变,长上下文靠解耦与 HBM 搭档。对照 TileRT、AgentX v3、AMZN/Trainium。
章节深链示例:/zh/r/sa-cerebras-cs4-2026#thesis
快照
- 原文日期
- 2026-08-19
- 晶圆/制程
- WSE-3 / 5nm
- 机架晶圆数
- 3(CS-3 为 2)
- 单架 TDP 约
- 125–135 kW
数据时点:2026-09-25(周度刷新;个股按 §A 标准档对齐,缺数用 N/A/null,非投资建议)
本篇为 SemiAnalysis 付费通讯的结构化研究笔记(摘要与投资映射),非原文转载;细节与数据以原文为准。
投资论点
CS-4 仍用 5nm WSE-3,靠功耗/时钟与三晶圆「背包」机架把单晶圆 tokens/s/user 约翻倍、BOM/晶圆成本接近上代;44GB SRAM 容量不变,长上下文靠解耦与 HBM 搭档。对照 TileRT、AMZN/Trainium。
核心分析
硬件:同晶圆、加倍频
SemiAnalysis:CS-4 第四代机架仍围绕 WSE-3(5nm),通过更高功耗与时钟、更好供电/散热,使单晶圆 tokens/s/user 约翻倍,峰值 FLOPs 与片外 I/O(约 1.2→2.4 Tb/s)同步抬升;片上 SRAM 仍约 44GB(由 bitcell 决定),容量要等下一代硅。
机架:「背包」三晶圆
机架拆成前半供电、后半算力;每个 backpack 一颗晶圆,一架三颗(CS-3 为两颗)。冷却泵/换热器外置适配液冷机房。部署可先上电再现场插入 backpack,制造与上架更快。单架约 125–135 kW(较 CS-3 单晶圆功耗量级显著上抬);性能/瓦最多微升,成本/晶圆或接近上代——对客户是「近似同 TCO、近双倍互动性」。
网络与解耦
新 I/O 模块(可现场升级)把专有 I/O 转标准以太网,利于与 AMD / AWS Trainium 等做 PDD / AFD 解耦:Cerebras 偏 decode,HBM 系统补容量。直连晶圆延迟可压到约 2µs,但相对竞品纳米秒级交换仍属「相对超快」;专家并行跨晶圆仍难,默认仍偏流水线并行。
与 GPU 互动性叙事
公司口径可达「相对 GPU 最高约 30×」互动性;SA 粗估 CS-4 约 ~4k tok/s/user vs CS-3 ~2k,Blackwell 现实并发约百量级 tok/s/user。真正对标要看 TileRT 把 GPU 推到高互动区后的差距,以及 AgentX v3 在 多轮 agentic 负载下 multi-GPU composability 是否仍 favor GPU 软件栈。长上下文(百万级)在高并发下可能需要数十套系统级 CAPEX。
标的与含义
| 方向 | 含义 | 站内对照 |
|---|---|---|
| Cerebras / 超快推理层 | 互动性溢价与解耦 decode 角色 | 私有公司;映射 NVDA 软件反击 |
| NVIDIA GPU 软件 | TileRT 等抬高 GPU 互动性上限 | TileRT · NVDA |
| AWS / Trainium | 异质解耦与 EFA 叙事 | AMZN |
| AMD | 解耦搭档之一 | AMD · CUDA moat |
展望
跟踪:Hot Chips 细节、CS-4 出货与 AWS/OpenAI 类部署、与 TileRT/Groq 的互动性对标、Nexus/CS-5 路线(约每年 2×、2027 吞吐目标量级)。
风险
参考 / 引用
- 原文(SemiAnalysis):Cerebras's Next Generation CS-4: Fast Just Got Faster
- Cerebras 官方 CS-4 发布:Introducing Cerebras CS-4
- 对照 TileRT:Ultra-High Interactivity on NVIDIA GPUs? - TileRT InferenceX
- AgentX v3(agentic 全栈):AgentX InferenceX v3 · 开源模型追赶
非投资建议。版权与完整论述归 SemiAnalysis / 原作者;本站仅作研究索引与对照。
评论
登录后评论