号称推理速度 30 倍于 GPU!Cerebras CS‑4 登场,晶圆级算力能否撼动 GPU 生态?

2026-08-20 10:34 小编 阅读 手机数码
8 月 18 日,Cerebras 在 Supernova 发布会正式推出新一代机架级 AI 系统CS‑4,官方给出极具冲击力的数据:单用户推理性能最高可达传统 GPU 服务器的 30 倍,2026 年 Q3 正式出货。

什么是 CS‑4?

CS‑4 是 Cerebras 首款多晶圆整机,采用全新 Nexus 机架平台,单机柜内置3 颗 WSE‑3 Turbo 晶圆级处理器。单颗 WSE‑3 Turbo 拥有 4 万亿晶体管、90 万 AI 核心,没有 HBM 显存,全部依靠片上 SRAM,单芯片内存带宽就达到 43.2PB/s,整机合计 750 PFLOPS 稀疏 FP16 算力、129.6 PB/s 总带宽,最大可跑50 万亿参数超大模型。晶圆之间直连通信,跨晶圆延迟压到 2μs;背包式模块化设计,部署从数天缩短到几小时,液冷微水道散热,每瓦吞吐量相比上代 CS‑3 提升最高 10 倍。

炸裂跑分:4465 Token/s

厂商内部基准测试 GPT‑OSS‑120B 模型:
  • CS‑4:4465 Token/s

  • 上代 CS‑3:2308 Token/s

  • 主流 GPU 服务器:131 Token/sCerebras

这就是 30 倍这个数字的来源。哪怕是 10 万亿参数以上的巨型模型,CS‑4 依旧可以保持每秒 1000 token 以上的生成速度。
这对 Agent 智能体意义重大:更快的 token 输出,意味着 AI 可以在相同时间完成更多工具调用、推理、自我校验,不再苦苦等待大模型吐字。

核心底层逻辑:绕开 “内存墙”

GPU 做推理最大瓶颈往往不是计算单元,而是数据搬运。权重需要反复在芯片和 HBM 显存来回传输,通信吃掉大量延迟。Cerebras 的思路是:把大量权重直接放在整片晶圆的片上 SRAM,尽量减少数据来回搬运,靠恐怖内存带宽换取低延迟推理表现。⚠️重点:CS‑4 主打推理,不是训练,不卖裸芯片,只交付整机机柜 + 云服务。

理性看待:30 倍≠全面碾压 GPU

很多人会直接解读成 “GPU 要被干掉”,这里必须划清边界:
  1. 30 倍是【单用户推理】跑分,是单个人对话的 token 速度。多用户高并发场景,这个倍数优势会被大幅稀释,不是所有场景都有 30 倍增益;并且为厂商自测,暂无第三方机构复测验证。

  2. 晶圆级整机成本极高,良率、维护成本昂贵,现阶段只面向超大规模云厂商、科研机构,普通企业消费不起。

  3. 软件生态远不如 GPU 成熟,属于异构算力补充,不是替代 GPU,未来更多是协同部署。

写在最后

CS‑4 代表晶圆级计算走到了新台阶,它解决的是超大模型单用户交互延迟痛点,尤其适配 Agent、超长上下文。但高昂的硬件成本、生态短板,决定短期不会大规模普及。AI 算力赛道,不会是单一方案一统天下,GPU、晶圆级芯片、各类 ASIC 还会长期共存。


版权声明

本文来源网络或会员投稿,版权归原作者所有,不代表本站立场。如因作品内容、版权等存在问题,请联系本站删除。

原文链接:https://www.chqiye.com/news/749.html

微信公众号

关注公众号

获取更多精彩内容