从三款芯片到万卡集群,云天励飞瞄准推理成本拐点
2026-07-21
11:20:55
来源: 互联网
点击
7 月 18 日,2026 世界人工智能大会(WAIC)如期举办。深圳云天励飞技术股份有限公司(以下简称云天励飞)副总裁罗忆受邀参加由观察者网、WAIC CONNECT主办,半导体行业观察协办的《重构算力——AI算力需求与供给的结构性重构产业链接会》。
会上罗忆先生表示,如果说过去两年的人工智能竞赛是一场关于“谁造出更大模型”的军备竞赛,那么从2026年开始,竞争的焦点正在发生根本性转移。从英伟达B200芯片的发布,到OpenAI o1系列模型的亮相,再到DeepSeek V4、智谱GLM-5等国产模型的密集迭代,AI行业已经越过了单纯的“训练冲刺期”,大步迈入以推理(Inference)为核心驱动力的新阶段。这不是一个温和的过渡,而是一次基础设施层面的彻底重构。

图:云天励飞副总裁罗忆
一、推理需求超越训练
根据科智咨询的预测,到2028年,全球推理算力需求将是训练算力需求的3至5倍。麦肯锡的数据模型同样显示,训练与推理的功率需求曲线约在2026年前后交叉,推理的复合年增长率(CAGR)比训练高出13%。到2030年,推理功率需求预计将达到训练的1.5倍。
这一趋势在真实数据中已经清晰可见。从2025年5月到2026年6月,OpenRouter平台上的模型周均Token调用量呈现指数级增长。国内豆包大模型的日均Token调用量同样以“万亿”为单位跃升。Token,正在成为AI时代新的“原油”计量单位。
罗忆先生分析,训练是“一次性、大集群、科研导向”的投入,而推理是“持续性、高频、运营与业务闭环导向”的常态化服务。前者追求绝对算力上限,后者苛求的是每Token的单位成本、时延、能效和吞吐量。当AI从“回答问题”走向“完成任务”,推理系统便不再是附属品,而是Agent的核心引擎。
在这一背景下,AI数据中心的功能定位发生了质变。它不再是堆砌GPU的“算力仓库”,而是一座持续、稳定、低成本生产Token的工厂。
英伟达CEO黄仁勋在GTC 2026上明确提出:“Inference是新的计算基础构件。”AWS也强调,推理系统已成为Agentic AI的基石。Token的价值天然存在分层——从低价值的通用问答,到中等价值的专业辅助,再到超高价值的复杂决策与实时控制。Token工厂的核心能力,正是将不同价值等级的Token,用最匹配的算力、模型和系统架构高效生产出来。
罗忆先生称,为了实现这一目标,未来推理基础设施将呈现三大技术趋势:
1,AFN与FFN分离:将注意力单元(Attention)与前馈网络单元(FFN)解耦,根据不同计算特征进行硬件差异化配置,整体吞吐可提升30%以上。
2,PD分离:将Pre fill(计算密集)与Decode(访存密集)阶段分离,结合流水异步调度,大幅优化MoE模型的推理效率。
3,超节点架构:通过全局统一显存寻址、Scale up通信优化和标准化快速交付,实现极致推理效率与极致性价比。
这些技术变革并非空中楼阁,而是已经在国产算力厂商的研发路线图中落地生根。
二、从推理侧突围
在出口管制持续收紧的背景下,英伟达在中国AI芯片市场的份额已从95%的高位,预计在2026年降至约8%。与此同时,国产AI芯片市场份额从2022年的15%攀升至2025年的41%,预计2026年将突破50%。
罗忆先生解释,这一“此消彼长”的背后,推理侧率先成为国产算力规模化落地的突破口。原因很直接:
1,推理任务对单芯片绝对性能的要求相对宽松,更关注能效比、单位Token成本和本地化交付能力;
2,国产芯片贴近行业客户,满足数据合规要求,具备交付确定性;
3,东部沿海城市承接低时延推理需求,西部大规模集群承接训练任务,形成“东推西训”的区域分工格局。
在这种情况以云天励飞为代表队的本土AI芯片供应商迎来历史发展机遇。
三,云天励飞公布“三款AI芯”+超节点异构集群
2026年初,云天励飞正式提出“训练追赶、推理超车”的战略方向。这一判断背后的逻辑清晰而有力:AI产业的重心正在从“训练”转向“推理”。公司用一个比喻阐释了这一转变:AI训练就像建发电厂,而AI推理就像建输电网络、造电动机——真正把电送到千家万户并高效应用,才是推动产业化的关键。
在芯片技术路线上,云天励飞推出了GPNPU架构。这一架构有四大技术亮点:兼容CUDA生态以降低客户迁移门槛;围绕推理能效比深度优化NPU内核;引入近存架构突破“内存墙”;采用“算力积木”架构构建机架级Scale-up超节点。
陈宁先生在“2026世界人工智能大会”重磅公布公司未来AI推理基础设施路线图。未来两年多,企业将推出DeepVerse100P、DeepVerse100D、DeepVerse100L三款云端大算力推理芯片,分别针对Prefill、Decode、Decode FFN三大推理环节的负载特征做专项优化。

图:云天励飞董事长兼CEO陈宁
依托三款专用芯片,云天励飞将搭建万卡(十万卡)级异构集群分离式AI推理基础设施。通过解耦各推理阶段,为不同负载匹配适配的芯片与算力资源,有效提升集群系统运行效率,持续压降Token生成成本。
此外,云天励飞围绕DeepVerse芯片及其集群应用,持续建设IFWA软件栈,为模型适配、算子优化、编译部署和软硬件协同提供软件支撑。
在兼容性方面,IFWA围绕Transformer主流架构,持续完善PyTorch ATen算子的适配和性能优化,并加强对vLLM、SGLang等主流推理框架的支持。通过兼容主流软件接口、复用成熟开源组件,降低模型向DeepVerse平台迁移和部署的成本。
在模型适配和开发效率方面,IFWA构建了覆盖模型量化、压缩、编译和部署的一站式自动化工具链,并引入AI Agent参与推理芯片适配和性能优化。
与此同时,云天励飞还将成熟的Triton算子能力融入FlagOS,通过代码贡献、联合验证和社区复用,推动相关能力在国产AI软件生态中进一步共享,减少不同硬件平台在算子适配上的重复投入。
四,推动实现“百亿Token一分钱”
降低Token生成成本是一项系统工程。
从芯片架构、IP与EDA,到封装测试、系统互联、软件栈和算力平台,再到模型及应用,产业链不同环节的效率都会影响最终的Token生成成本。实现极致性价比的Token,需要产业链上下游共同参与。
罗忆先生称,云天励飞联合产业伙伴提出的“1001计划”,将围绕Token生成效率和成本,推动产业链上下游加强协同。通过更加紧密的产业合作,使模型和应用需求更早反馈至芯片及系统设计环节,推动成熟软件能力加快复用,同时加速芯片在集群和实际场景中的验证和应用。
目前,已经有30余家来自AI产业链上下游的企业加入到“1001计划”中。
对比当前国内百万Token约1元的较优水平,“百亿Token一分钱”意味着将同等规模Token的成本从约1万元降至1分钱。如此大幅度的成本下降,不可能依靠单颗芯片或单一环节完成,而需要芯片设计、模型压缩、集群调度、硬件互联和运营体系的协同优化。
这也意味着,AI芯片的竞争标准正在发生变化。随着推理需求持续增长,市场关注的重点将从单颗芯片的峰值性能,进一步延伸到集群吞吐、单位Token成本、时延和服务稳定性。国产芯片已经在通用问答等低成本推理场景中实现规模应用,下一步能否进入专业辅助、实时决策和多模态交互等更高价值场景,取决于芯片与系统能否形成整体效率优势。
云天励飞此次发布的三款推理芯片及万卡级异构集群,正是围绕这一方向展开:针对Prefill、Decode和Decode FFN的不同负载特征设计专用芯片,再通过分离式架构和集群调度,将单点芯片能力转化为系统级的Token生产效率。
“百亿Token一分钱”目前仍是一个面向未来的目标,但它指向了AI推理产业越来越清晰的竞争主线:谁能以更低成本、更高效率持续生产高质量Token,谁就更有机会推动AI从少数高价值场景,进入更广泛、更高频的产业应用。云天励飞正在用三款芯片和万卡集群,向这一目标迈进。
会上罗忆先生表示,如果说过去两年的人工智能竞赛是一场关于“谁造出更大模型”的军备竞赛,那么从2026年开始,竞争的焦点正在发生根本性转移。从英伟达B200芯片的发布,到OpenAI o1系列模型的亮相,再到DeepSeek V4、智谱GLM-5等国产模型的密集迭代,AI行业已经越过了单纯的“训练冲刺期”,大步迈入以推理(Inference)为核心驱动力的新阶段。这不是一个温和的过渡,而是一次基础设施层面的彻底重构。

图:云天励飞副总裁罗忆
一、推理需求超越训练
根据科智咨询的预测,到2028年,全球推理算力需求将是训练算力需求的3至5倍。麦肯锡的数据模型同样显示,训练与推理的功率需求曲线约在2026年前后交叉,推理的复合年增长率(CAGR)比训练高出13%。到2030年,推理功率需求预计将达到训练的1.5倍。
这一趋势在真实数据中已经清晰可见。从2025年5月到2026年6月,OpenRouter平台上的模型周均Token调用量呈现指数级增长。国内豆包大模型的日均Token调用量同样以“万亿”为单位跃升。Token,正在成为AI时代新的“原油”计量单位。
罗忆先生分析,训练是“一次性、大集群、科研导向”的投入,而推理是“持续性、高频、运营与业务闭环导向”的常态化服务。前者追求绝对算力上限,后者苛求的是每Token的单位成本、时延、能效和吞吐量。当AI从“回答问题”走向“完成任务”,推理系统便不再是附属品,而是Agent的核心引擎。
在这一背景下,AI数据中心的功能定位发生了质变。它不再是堆砌GPU的“算力仓库”,而是一座持续、稳定、低成本生产Token的工厂。
英伟达CEO黄仁勋在GTC 2026上明确提出:“Inference是新的计算基础构件。”AWS也强调,推理系统已成为Agentic AI的基石。Token的价值天然存在分层——从低价值的通用问答,到中等价值的专业辅助,再到超高价值的复杂决策与实时控制。Token工厂的核心能力,正是将不同价值等级的Token,用最匹配的算力、模型和系统架构高效生产出来。
罗忆先生称,为了实现这一目标,未来推理基础设施将呈现三大技术趋势:
1,AFN与FFN分离:将注意力单元(Attention)与前馈网络单元(FFN)解耦,根据不同计算特征进行硬件差异化配置,整体吞吐可提升30%以上。
2,PD分离:将Pre fill(计算密集)与Decode(访存密集)阶段分离,结合流水异步调度,大幅优化MoE模型的推理效率。
3,超节点架构:通过全局统一显存寻址、Scale up通信优化和标准化快速交付,实现极致推理效率与极致性价比。
这些技术变革并非空中楼阁,而是已经在国产算力厂商的研发路线图中落地生根。
二、从推理侧突围
在出口管制持续收紧的背景下,英伟达在中国AI芯片市场的份额已从95%的高位,预计在2026年降至约8%。与此同时,国产AI芯片市场份额从2022年的15%攀升至2025年的41%,预计2026年将突破50%。
罗忆先生解释,这一“此消彼长”的背后,推理侧率先成为国产算力规模化落地的突破口。原因很直接:
1,推理任务对单芯片绝对性能的要求相对宽松,更关注能效比、单位Token成本和本地化交付能力;
2,国产芯片贴近行业客户,满足数据合规要求,具备交付确定性;
3,东部沿海城市承接低时延推理需求,西部大规模集群承接训练任务,形成“东推西训”的区域分工格局。
在这种情况以云天励飞为代表队的本土AI芯片供应商迎来历史发展机遇。
三,云天励飞公布“三款AI芯”+超节点异构集群
2026年初,云天励飞正式提出“训练追赶、推理超车”的战略方向。这一判断背后的逻辑清晰而有力:AI产业的重心正在从“训练”转向“推理”。公司用一个比喻阐释了这一转变:AI训练就像建发电厂,而AI推理就像建输电网络、造电动机——真正把电送到千家万户并高效应用,才是推动产业化的关键。
在芯片技术路线上,云天励飞推出了GPNPU架构。这一架构有四大技术亮点:兼容CUDA生态以降低客户迁移门槛;围绕推理能效比深度优化NPU内核;引入近存架构突破“内存墙”;采用“算力积木”架构构建机架级Scale-up超节点。
陈宁先生在“2026世界人工智能大会”重磅公布公司未来AI推理基础设施路线图。未来两年多,企业将推出DeepVerse100P、DeepVerse100D、DeepVerse100L三款云端大算力推理芯片,分别针对Prefill、Decode、Decode FFN三大推理环节的负载特征做专项优化。

图:云天励飞董事长兼CEO陈宁
依托三款专用芯片,云天励飞将搭建万卡(十万卡)级异构集群分离式AI推理基础设施。通过解耦各推理阶段,为不同负载匹配适配的芯片与算力资源,有效提升集群系统运行效率,持续压降Token生成成本。
此外,云天励飞围绕DeepVerse芯片及其集群应用,持续建设IFWA软件栈,为模型适配、算子优化、编译部署和软硬件协同提供软件支撑。
在兼容性方面,IFWA围绕Transformer主流架构,持续完善PyTorch ATen算子的适配和性能优化,并加强对vLLM、SGLang等主流推理框架的支持。通过兼容主流软件接口、复用成熟开源组件,降低模型向DeepVerse平台迁移和部署的成本。
在模型适配和开发效率方面,IFWA构建了覆盖模型量化、压缩、编译和部署的一站式自动化工具链,并引入AI Agent参与推理芯片适配和性能优化。
与此同时,云天励飞还将成熟的Triton算子能力融入FlagOS,通过代码贡献、联合验证和社区复用,推动相关能力在国产AI软件生态中进一步共享,减少不同硬件平台在算子适配上的重复投入。
四,推动实现“百亿Token一分钱”
降低Token生成成本是一项系统工程。
从芯片架构、IP与EDA,到封装测试、系统互联、软件栈和算力平台,再到模型及应用,产业链不同环节的效率都会影响最终的Token生成成本。实现极致性价比的Token,需要产业链上下游共同参与。
罗忆先生称,云天励飞联合产业伙伴提出的“1001计划”,将围绕Token生成效率和成本,推动产业链上下游加强协同。通过更加紧密的产业合作,使模型和应用需求更早反馈至芯片及系统设计环节,推动成熟软件能力加快复用,同时加速芯片在集群和实际场景中的验证和应用。
目前,已经有30余家来自AI产业链上下游的企业加入到“1001计划”中。
对比当前国内百万Token约1元的较优水平,“百亿Token一分钱”意味着将同等规模Token的成本从约1万元降至1分钱。如此大幅度的成本下降,不可能依靠单颗芯片或单一环节完成,而需要芯片设计、模型压缩、集群调度、硬件互联和运营体系的协同优化。
这也意味着,AI芯片的竞争标准正在发生变化。随着推理需求持续增长,市场关注的重点将从单颗芯片的峰值性能,进一步延伸到集群吞吐、单位Token成本、时延和服务稳定性。国产芯片已经在通用问答等低成本推理场景中实现规模应用,下一步能否进入专业辅助、实时决策和多模态交互等更高价值场景,取决于芯片与系统能否形成整体效率优势。
云天励飞此次发布的三款推理芯片及万卡级异构集群,正是围绕这一方向展开:针对Prefill、Decode和Decode FFN的不同负载特征设计专用芯片,再通过分离式架构和集群调度,将单点芯片能力转化为系统级的Token生产效率。
“百亿Token一分钱”目前仍是一个面向未来的目标,但它指向了AI推理产业越来越清晰的竞争主线:谁能以更低成本、更高效率持续生产高质量Token,谁就更有机会推动AI从少数高价值场景,进入更广泛、更高频的产业应用。云天励飞正在用三款芯片和万卡集群,向这一目标迈进。
责任编辑:SemiInsights
相关文章
-
- 半导体行业观察
-
- 摩尔芯闻