NVDA, AMD, AMZN · US

Cerebras CS-4: same wafer, 2× clock, disagg rack | SemiAnalysis note

CS-4 keeps 5nm WSE-3; power/clock + 3-wafer backpack rack ~2× tok/s/user at similar BOM/wafer. 44GB SRAM unchanged—long-context needs disagg + HBM partners. See TileRT, AgentX v3, AMZN/Trainium.

Published Updated Open interactive reader

Download MarkdownExport PDF

Cite a section with a deep link, e.g. /en/r/sa-cerebras-cs4-2026#thesis

Snapshot

Date
2026-08-19
晶圆/制程
WSE-3 / 5nm
机架晶圆数
3(CS-3 为 2)
单架 TDP 约
125–135 kW
As of 2026-09-25

As-of 2026-09-25 (weekly refresh; equities aligned to §A. Missing series are N/A/null. Not investment advice.)

Structured research note on a SemiAnalysis piece (summary + investable mapping)—not a reprint. Defer to the original for detail.

Thesis

CS-4 keeps 5nm WSE-3; power/clock + 3-wafer backpack rack ~2× tok/s/user at similar BOM/wafer. 44GB SRAM unchanged—long-context needs disagg + HBM partners. See TileRT, AMZN/Trainium.

Analysis

Same wafer, 2× clock

CS-4 keeps WSE-3 (5nm); higher power/clock and better delivery/cooling roughly double tok/s/user per wafer; FLOPs and off-wafer I/O (~1.2→2.4 Tb/s) rise; ~44GB SRAM unchanged until next silicon.

Backpack rack (3 wafers)

Front power / rear compute; three backpacks per rack vs two on CS-3; external liquid cooling. Deploy power first, socket wafers later. Rack ~125–135 kW. Perf/W flat-to-slightly up; BOM/wafer may be similar—near 2× interactivity at similar TCO.

Networking & disagg

Field-upgradeable I/O enables Ethernet and AMD / Trainium partners for PDD/AFD; Cerebras as decode, HBM systems for capacity. Direct wafer links ~2µs—still “relatively” ultrafast vs ns-class competitors. Pipeline parallel remains default.

GPU interactivity narrative

Marketing “up to ~30× GPUs”; SA ballpark CS-4 ~4k vs CS-3 ~2k tok/s/user vs realistic Blackwell concurrency ~100s. Compare after TileRT. Long-context concurrency can require tens of systems.

Implications

Angle Implication Site map
Cerebras / 超快推理层 互动性溢价与解耦 decode 角色 私有公司;映射 NVDA 软件反击
NVIDIA GPU 软件 TileRT 等抬高 GPU 互动性上限 TileRT · NVDA
AWS / Trainium 异质解耦与 EFA 叙事 AMZN
AMD 解耦搭档之一 AMD · CUDA moat

Outlook

Watch Hot Chips detail, CS-4 ship + AWS/OpenAI-class deploys, interactivity vs TileRT/Groq, Nexus/CS-5 (~2×/yr, 2027 throughput goal). AgentX v3 tests whether multi-GPU composability on agentic traces still favors GPU software stacks over wafer-scale specialty silicon.

Risks

References

  1. 原文(SemiAnalysis): Cerebras's Next Generation CS-4: Fast Just Got Faster
  2. Cerebras 官方 CS-4 发布: Introducing Cerebras CS-4
  3. 对照 TileRT: Ultra-High Interactivity on NVIDIA GPUs? - TileRT InferenceX
  4. AgentX v3 (agentic full stack): AgentX InferenceX v3 · Open models catching up

Not investment advice. Copyright remains with SemiAnalysis / authors; this is an index note.

Disclaimer: For research information only. Not investment advice or a recommendation to buy or sell.

Comments

Sign in to comment

Loading…