NVDA, AMD · 美股

TileRT:NVIDIA GPU 上的超高互动性?|SemiAnalysis 笔记

「Fast mode」证明用户愿为低延迟付溢价。TileRT 把 decode 图静态编译为持久化 kernel;InferenceX 上 B200 可达约数百 tok/s/user,同成本互动性可显著高于传统引擎。对照 CS-4、Rubin TCO、AgentX v3。

发布 更新 打开交互阅读器

下载 Markdown导出 PDF

章节深链示例:/zh/r/sa-tilert-inferencex-2026#thesis

快照

原文日期
2026-08-10
基准场景
InferenceX / GLM5 等
B200 互动性量级
最高约 ~500 tok/s/user(文中)
相对传统引擎
约 2–3× 互动性(场景依赖)
数据截至 2026-09-25

数据时点:2026-09-25(周度刷新;个股按 §A 标准档对齐,缺数用 N/A/null,非投资建议)

本篇为 SemiAnalysis 付费通讯的结构化研究笔记(摘要与投资映射),非原文转载;细节与数据以原文为准。

投资论点

「Fast mode」证明用户愿为低延迟付溢价。TileRT 把 decode 图静态编译为持久化 kernel;InferenceX 上 B200 可达约数百 tok/s/user,同成本互动性可显著高于传统引擎。对照 CS-4、Rubin TCO。

核心分析

为什么重要

付费「快速模式」显示低延迟有溢价与更高毛利空间。Frontier 实验室因此评估 Cerebras、Groq LPU 等专用推理,也迫使 NVIDIA 软件 回答:GPU 集群能否进入同一互动性帕累托前沿。

TileRT 做法

将整个 decode 图静态编译为 GPU 上的 持久化 kernel,最大化计算、访存与通信重叠。InferenceX 场景下,单 B200 decode 服务器可测到最高约 500 tok/s/user 量级(文中相对 GB300 上传统引擎可达约 3× 等量级对比,视 workload);同成本下互动性也可显著改善。优势主要在 decode 尾部;TTFT 尚可但非绝对强项。

生态与对照

与 vLLM/SGLang/Dynamo 等栈、以及 Cerebras/Groq 专用硅同场竞技。AMD MI455X、Google TPUv7 等也将进入 InferenceX 对照。读法:不要只看峰值 tok/s,要看 iso-cost / iso-power 与真实 agentic 负载——以 AgentX InferenceX v3(393 Claude Code trace、95%+ KV 复用)为生产代理基准,对照 开源模型追赶 中的 Kimi K3 / GLM-5.2。

标的与含义

方向 含义 站内对照
NVDA 软件护城河 抬高 GPU 互动性上限,延缓份额流失到专用硅 NVDA · Rubin
专用推理硅 仍可能在极低 batch 占优,但差距可被软件压缩 CS-4
AMD / 开源栈 SGLang 等需持续对标 AMD

展望

跟踪:InferenceX 可验证提交(Rubin、TPUv7、MI455X)、TileRT 生产采用与定价「Fast」产品线、与 CS-4/Groq 的同负载对比;AgentX v3 已把 benchmark 从单节点互动性扩展到 多轮 agentic 全栈 composability。

风险

参考 / 引用

  1. 原文(SemiAnalysis):Ultra-High Interactivity on NVIDIA GPUs? - TileRT InferenceX
  2. InferenceX v2:NVIDIA Blackwell Vs AMD vs Hopper
  3. 对照 CS-4:Cerebras CS-4
  4. AgentX v3(agentic 全栈):AgentX InferenceX v3 · 原文

非投资建议。版权与完整论述归 SemiAnalysis / 原作者;本站仅作研究索引与对照。

免责声明:本文仅为研究信息,不构成任何投资建议或买卖推荐。

评论

登录后评论

加载中…