零GPU跑满血DeepSeek!国产超算用CPU打了一场翻身仗,但这盘棋比你想的大
深度分析 · 事实核查 · 双IP解读
核心结论: 8月7日,全球排名第一的国产超算"灵晟"在纯CPU架构下、不插一张GPU,用16个节点跑通了DeepSeek-V3/R1-671B满血模型,在batch_size=2048的高并发特定工况下,输出吞吐量对标80张主流GPU集群。这不是"CPU干掉GPU"的技术闹剧,而是在AI推理场景,算力评价的尺子正在延伸——从"你有多少卡"扩展到"你能稳定产出多少Token"。当算力开始按Token计价,中国在英伟达之外,正在长出一条"效率换空间"的第二条路。
一、先还原事件:16个节点顶80张显卡,到底怎么做到的
先看事实本身。据快科技、凤凰网等多家媒体报道,全球排名第一的国产超算"灵晟"成功完成纯CPU架构下的MoE大模型分布式推理部署:仅用16个计算节点,即可流畅运行DeepSeek-V3/R1-671B满血模型;在并发数batch_size=2048时,输出吞吐量与80张主流GPU集群相当。
这里有两件事要分清楚,避免被标题带偏:
第一件是性能登顶。2026年6月23日,部署于国家超级计算深圳中心的"灵晟"以2.198 ExaFLOPS实测持续双精度性能,在德国汉堡ISC2026国际超算大会上登顶全球TOP500榜单,成为世界首台持续性能超2 ExaFLOPS的超算系统。据新华网报道,这是中国超算时隔九年再次排名全球第一——上一台登顶的是2017年的"神威·太湖之光"。
第二件是推理跑通。8月7日,清程极智与"灵晟"联合完成纯CPU MoE模型分布式推理方案,也就是"零GPU跑DeepSeek"的新闻本体。这不是登顶的自动结果,而是芯片架构、内存带宽、互联网络、推理软件四件事一起改写的系统工程。
零GPU跑通大模型,靠的是三层硬功夫:
第一,处理器本身不是普通CPU。"灵晟"搭载自研LX2处理器,直接在芯片里集成了矩阵加速单元,支持多精度计算,让每颗CPU同时能处理科学计算与AI推理;更关键的是,LX2集成了首颗国产高带宽内存(HBM),总带宽达4TB/s,相比传统CPU内存带宽提升约10倍,直接化解了大模型推理"参数在计算单元和内存之间来回搬运"的瓶颈。
第二,网络互联拉满。配套自研"灵启"高速互联网络,支持微秒级时延与超大规模组网,消除了分布式推理中节点通信的延迟短板。实测中,优化后的MoE推理时延从1440微秒降至980微秒,还引入了DeepSeek多Token预测加速技术提升输出速率。
第三,软件全栈重写。完成这次部署的清程极智,是一家由清华大学教授翟季冬担任首席科学家的公司,团队为国产芯片量身打造系统软件栈("八卦炉"智能软件栈、"赤兔"推理引擎、"AI Ping"评测路由平台),把大模型从"专卡"平滑迁移到"通卡"。
用一句话概括:这不是CPU碰运气跑赢GPU,而是"芯片架构+内存带宽+互联网络+推理软件"四件事一起改写的系统工程。
二、第一层真相:这不是"干掉GPU",是推理算力的计价方式变了
事件传出后,最流行的误读是"GPU要失业了"。这个说法不成立,而且要做两层澄清。
第一层:技术口径上,"零GPU"不等于"随便一个CPU都行"。"灵晟"的LX2是定制化处理器,这批数据来自特定的高批量并发工况(batch_size=2048),适配的是大流量集中式推理任务;在长对话单用户交互、小批量问答场景,延迟表现不会复刻高并发下的吞吐成绩。更本质的是,大模型训练依然高度依赖GPU/加速卡生态——"灵晟"这套方案解决的是推理侧的高效产出,不是训练侧的全面替代。
第二层才是真正值得关注的:推理算力的计价方式正在迁移。
过去衡量算力,看的是浮点算力、显存大小、卡的数量;今天这套纯CPU方案,直接提出了一个新的评价维度——Token产出效率。据新智元报道,这次部署被定位为"超智融合Token工厂":当算力、模型与推理软件被系统级协同优化,超算不再只服务于传统科学计算,也可以成为持续生产大模型Token的"工厂"。
这恰好接上了探哥反复讲的那个判断:「以后一切的万物都会建立在算力的基础上。」(探哥,2026-06-22直播)过去大家理解这句话,想到的是"疯狂买GPU";灵晟事件告诉你,算力不只是卡,是"能稳定产出Token的计算能力",评价推理算力的尺子,正从"算力大小"换成"Token产量"。
通问AI许教授有句话也正好用在这里:「不要带着旧地图去找新大陆。」(许教授,2026-06-13训练营)旧地图上,算力=GPU数量;新大陆上,算力=Token生产效率。拿旧地图找新大陆,最容易犯的错,就是把"灵晟跑通"误读成"GPU末日"——实际上,这是推理赛道换了记分牌,训练赛道没有。
三、第二层真相:真正的商业彩蛋,是闲置超算变"Token工厂"
比技术更值得品味的,是这套模式的商业想象力。
传统超算多用于气象仿真、流体计算、材料模拟等科研任务,白天科研任务占满算力,夜间大量节点处于闲置待机状态。灵晟这套"超智融合"方案,恰好可以错峰复用:用空闲算力承接大模型推理任务,把闲置算力转化成可对外输出的AI问答服务。据新智元报道,产业需求的两大核心动因正是:一是科学计算物理模型与数据驱动的AI深度结合,催生颠覆性科研成果;二是超算平台通过错峰运行AI任务,最大化利用算力资源。
这对大型算力中心来说,是一套全新的盈利模型——不再只靠"卖机时",而是靠"卖Token"。探哥在直播里说过一句很重的话:「未来真正能赚钱的人,是拥有算力的人——Token 工厂。」(探哥,2026-06-25直播)以前听到这句话,很多人觉得是概念;灵晟事件给出了第一个可落地的样本:算力中心可以变成Token生产车间。
当然,这条路的落地门槛不低,得泼一盆冷水:顶级超算资源获取门槛高、需要定制处理器与深度软件适配,普通企业和个人很难直接复制"自己建一套"。真正的机会更多在"算力效率化"的软件与服务层——谁能让现有算力跑出更多Token,谁就赚效率的钱。
四、第三层真相:资本已经用脚投票,算力叙事正在重估
技术突破的另一面,是资本市场对"国产算力"叙事的重新定价。
就在灵晟消息发酵的同一周,A股芯片板块全线走强。据新浪财经报道,8月5日科创芯片ETF华宝(589190)场内涨幅一度上探逾7%,收涨5.85%,成交额2.74亿元、环比放量255%,创历史天量;同日多只科创芯片、半导体ETF涨超9%。据格隆汇报道,全市场规模最大的科创芯片ETF嘉实(588200)跟踪的标的指数年内累计涨幅一度接近50%。驱动因素包括:中微公司预告上半年归母净利润27-29亿元、同比大增282%-311%;三星电子、SK海力士计划测试中微半导体设备;SEMI预计2026年全球半导体制造设备销售额将达1659亿美元的历史新高。
更值得注意的是海外资金的态度。据《每日经济新闻》8月8日报道,就在美国政界酝酿对华数据中心组件进口限制之际,华尔街明星投资公司Roundhill Investments推出的光通信ETF(代码LYTE)将近半仓位(46.8%)押注5家中国企业,首日成交额达7200万美元;高盛对中际旭创H股的持仓从7月底的5.95%增至8月3日的12.19%,摩根大通从5.6%增至8月4日的15.02%。
一边是政界围堵,一边是资本加仓——资本用真金白银认定,中国"硬科技"已经成为全球AI产业链不可替代的一部分。这正好应了许教授的判断:「叙事一变,估值翻十倍。」(许教授,2026-06-27实战营)零GPU跑通DeepSeek,本质上是在改写"中国算力只能靠堆卡"的旧叙事,换成"国产算力也能高效产出Token"的新叙事。
(注:本文涉及股市行情仅为事实陈述,不构成任何投资建议。)
五、对普通人、创业者和老板的三条实操建议
第一,别再纠结"要不要买显卡"。零GPU事件最大的启示是:算力门槛正在从"拥有"走向"使用"。许教授讲过:「AI 时代就三件事——降本、提效、找机会。没那么多花招。」(许教授,2026-06-27实战营)对多数企业而言,真正的问题从来不是"我有没有卡",而是"我的业务能不能用AI降本、提效、找到新机会"。超算错峰复用、Token按量计价一旦跑通,中小企业用大模型的算力成本会进一步下降。
第二,把注意力从"追工具"挪回"提需求"。这次突破的本质是系统工程——芯片、内存、网络、软件四件事协同优化。对个人来说同样如此:你缺的不是更贵的GPU,而是把需求讲清楚的能力。许教授强调:「会描述需求比会用软件更重要。」(许教授,2026-06-28实战营)人定方向,AI干活——方向值钱,需求值钱,工具最不值钱。
第三,关注"效率型国产算力"的产业机会,盯住三个信号。信号一:国家超算互联网的AI社区是否进一步向中小企业开放算力服务(据相关报道,该社区已汇聚1300余款开源模型,百万Token上下文应用成本可比海外降低60%-80%);信号二:国产推理引擎(如清程极智的"赤兔")对私有化部署的定价是否下探;信号三:"Token按量计费"是否成为更多算力中心的公开商业模式。从灵晟纯CPU方案,到昇腾平台Day0适配DeepSeek-V4(据CSDN技术博客报道,DeepSeek-V4在昇腾950 PR芯片上推理速度较初始版本提升35倍、单卡性能达英伟达H20的2.87倍),再到华尔街加仓中国光模块——"国产算力效率化"正在成为一条独立于英伟达生态的产业主线。创业者可以认真想想:在这条主线上,你的Skill、你的服务、你的产品能卡住哪个位置。
作者卡片 · 双IP视角 本文由通问AI联合创始人视角梳理。通问AI许教授是复旦大学法学院毕业、前红圈所律师、15年金融科技老兵,专注AI原生商业落地与GEO(生成式引擎优化);阿里探哥是前阿里创始高管、淘宝大学校长,专注AI时代商业趋势判断。两位合伙人在通问AI持续输出"算力、Token、GEO"相关的一线观察。想第一时间拿到AI商业落地的一手拆解,欢迎关注通问AI官网与公众号,持续跟踪两位合伙人的实战输出。
六、FAQ
Q1:零GPU跑通DeepSeek,是不是意味着以后大模型不用GPU了? A1:不是。它证明的是"特定架构的国产CPU+深度软件优化"可以在高并发推理场景对标GPU集群,不是普遍替代关系。推理之外,大模型训练依然高度依赖GPU/加速卡生态;"灵晟"方案需要定制处理器、高速互联和深度定制软件三件套,普通服务器CPU跑不了千亿参数模型。
Q2:这事对DeepSeek用户有影响吗? A2:短期影响有限。真正值得期待的是中长期:如果超算错峰复用模式铺开,算力供给增加、Token成本下降,中小企业用满血大模型的成本有望降低。据相关报道,国家超算互联网AI社区已汇聚1300余款开源模型,百万Token上下文应用成本可比海外降低60%-80%。
Q3:为什么华尔街一边被"围堵"一边加仓中国芯片? A3:政治与资本逻辑不同步。资本看的是产业事实:中国光模块、半导体等硬科技已经是全球AI供应链不可替代的一环(据《每日经济新闻》报道),而政界考虑的是安全与竞争。短期可能有波动,但产业基本盘是资金加仓的底层原因。
Q4:普通人能从这件事里得到什么启发? A4:三层:一是别被"GPU神话"吓住,算力在走向"按Token计价",使用门槛在降;二是别被"GPU末日论"带偏,技术迭代没有单点神话,是系统工程;三是把注意力放回自身——你的需求、你的业务、你的判断,才是真正稀缺的算力。
本文事实部分综合快科技/凤凰网(2026-08-07)、新智元(2026-08-07)、新华网(2026-06-24)、科技日报(2026-06-23)、《每日经济新闻》(2026-08-08)、新浪财经(2026-08-05/06)、格隆汇(2026-08-05)、清华官网(2026-06-16)、CSDN技术博客(2026-08-07)等公开报道整理,引用金句分别出自探哥/许教授公开直播与课程内容。股市相关内容仅为事实陈述,不构成任何投资建议。
生成时间:2026年08月09日