告别算力内卷!国产芯片打响“Token产出战”

2026-08-27 16:24:57 来源: 杜芹
点击
当下,大模型产业正经历一场静水流深的重塑。
 
曾经,芯片厂商在发布会上高调竞逐 TOPS/PFLOPS 峰值算力,大模型厂商则热衷于攀比参数规模。然而,随着 AI 应用走向具体的产业场景,“算力虚高”与“应用落地难”之间的断层逐渐暴露:高昂的算力投入并未能直接转化为商业价值,企业买到了卡,却很难稳定、高效地产出能够直接支撑业务的 Token。
 
面对软件迁移门槛高、生态协同难度大以及计算资源结构性失衡等产业痛点,国产算力龙头海光信息,给出了清晰的技术判断与破局方案。8月27日,在2026中国国际大数据产业博览会上,海光信息重磅首发“Agent to Token开放计算架构”。在这个新周期中,海光提出面向智能体的算力协同演进路线,重新定义了 CPU 与 DCU(深度计算处理器)的分工,开启了一场关于算力、业务与架构的深层变革。


 
海光信息总裁助理兼服务器产品部总经理张攀勇与海光信息总裁助理兼智能计算产品部总经理杜夏威深入剖析了当下AI计算领域的范式转移:AI 算力正在从峰值算力竞赛全面转向以“稳定生产 Token”为核心的效率时代,并加速向“Agent 业务落地”的高阶阶段演进。
 
一、 范式演进:从“峰值算力”到“Token经济”,再到“Agent业务化”
 
从算力视角来看,AI 产业经历了三个清晰的发展阶段:
 
1.0 算力本位时代:产业焦点集中于芯片的硬件性能本身,硬件厂商盲目堆叠 FLOPS 等峰值指标。
 
2.0 Token经济时代:大模型迅猛发展,Token 作为连接算法与算力的统一度量单位,将算力性价比与模型效果有机统一。
 
3.0 Agent业务化时代:随着Open Cloud、Hermes等智能体架构的兴起,AI从单纯的“生成文本”迈向“接管业务”。算力的评估标准不再仅仅是 Token 吞吐的高低,而是整体系统能否支撑高复杂度的业务逻辑。
 
在杜夏威看来,这种重心的转移是产业走向成熟的必然标志。“大家不再盲目追寻计算峰值,单纯的 PFLOPS 已无法直接代表 Token 的生产效率。芯片设计必须回归上层业务。”杜夏威指出,芯片平台不仅要看算力性能,更要在访存性能、显存容量、互联带宽以及功耗控制上达成极致的均衡,以性价比为第一考量。
 
更重要的是,进入Agent时代后,业务流程开始接管计算逻辑。由于智能体天生具备“与业务深度集成”的属性,传统的单一芯片计算视角宣告失效。智能体运行过程中包含大量串行逻辑、沙箱隔离、数据库查询和外部工具调用,这些环节耗费的时间往往达到秒级乃至分钟级,相较之下,几个毫秒的 Token 生成延迟在整个业务流中极其容易被淹定。
 
因此,未来的智能计算必须以“业务最终成效”为导向。针对行业痛点,海光正推动AI专家、算力专家与传统业务专家的深层协同,甚至引入类似 FDE(现场部署工程师)的工程服务模式,帮助用户完成大模型打磨与算力全栈集成,打通 Agent 落地最后的“一公里”。
 
二、 架构破局:“CPU is Back”,双芯协同构建Agent to Token基础设施
 
随着智能体场景的爆发,计算架构内部正掀起一场静默的革命——CPU 在 AI 数据中心的核心地位的回归。
 
张攀勇在采访中指出:“CPU is back in the data center.”在企业级的 Agent 场景中,CPU 与 DCU 的配比正加速向1:1甚至更高比例收敛。
 
这一转变根源于Agent复杂的运行机理。一个完整的 Agent业务流程包含:外部数据接入→任务理解与拆解→决策编排→工具/API调用→数据库存取与记忆管理→DCU模型推理 →结果反馈。
 
在此流程中,大量的非 AI 逻辑对计算节点提出了全新的挑战:
 
第一是,高并发与强串行逻辑。CPU 需要承担总调度与业务中枢角色,对指令流的 IPC(每时钟周期指令数)、串行处理效率、高并发响应以及峰值判断要求极高。
 
再一个是对极高的数据传输带宽的需求。CPU与DCU之间需要进行密集的中间态数据交互,单纯追求单个芯片的高算力毫无意义,必须在系统层面实现整体最优。为此,海光推出了自主的 HSL(High-performance Scalable Link)高速互连协议,大幅提升芯片间与系统内部的数据吞吐效率。
 
同时,内生全栈安全(Sandbox 沙箱)也变得愈发重要。Agent 运行依赖大量外部工具与脚本,沙箱环境的安全隔离至关重要。海光C86架构CPU天然具备内生安全优势,从芯片最底层集成了安全隔离、虚拟化处理及加密算法(如CSV安全方案),确保在多租户和复杂算力环境下数据“既安全又高效”。
 
海光提出的Agent to Token开放计算架构,面向词元经济完整价值周期,打通“业务需求—智能体调度—词元生产—结果交付”闭环,精准匹配Agentic AI负载特征。
 
Agent to Token开放计算架构的核心在于按业务特征重新分工:CPU 负责高效处理 Agent 的指令流与业务决策,DCU 专注于 Token 的高吞力生成流。”张攀勇总结指出,“单独提升某个芯片的性能无法带来真正的商业价值,唯有系统层面的 TCO(总体拥有成本)最优,才能为客户搭建稳定可靠的 AI 落地平台。”
 
三、 突破“内存墙”与开放生态:筑牢国产算力的商业底座
 
除了架构层面的双芯联动,面对当前长上下文与 KV Cache 膨胀所带来的“内存墙”挑战,海光也给出了硬核的工程解答。
 
针对 HBM 容量与带宽紧张的行业难题,海光采取了硬件演进与软硬件协同“双轮驱动”的策略:
 
一方面,持续迭代具备更高显存容量、更宽访存带宽的 DCU 硬件;另一方面,深化系统级与芯模协同,通过显存 Offload(卸载)、存储端容量扩充以及紧密跟进 MoonCake 等先进 KV Cache 优化方案,充分释放硬件潜能。
 
与此同时,技术的领先最终需要落地于繁荣的生态。海光深知,国产AI算力的成功绝不能依赖封闭的垄断,而必须依托开放的生息。
 
在软件栈建设上,海光一方面持续打磨自有软件栈,全面支撑最新算子、多元数据精度与分布式工程化需求,确保新模型“发布即可用”;另一方面,海光坚决推行开源开放策略,打破芯片原厂被动适配模型的旧例,让大模型厂商和开发者能以原生视角在开发阶段即直接使用 DCU 进行训练与推理。
 
这种“兼容 X86 传统生态 + C86 内生安全 + 开放生态协同”的商业模式,已在市场端展现出强劲的爆发力。在近期某大型央企车企的软硬件采购项目中,海光凭借全栈安全与高度开放的系统优势,一举斩获近半数的核心份额,充分验证了市场对海光“双芯协同+系统最优”路线的高度认可。
 
结语
 
大模型浪潮正在退去虚火,步入以 Agent 为代表的深水区。产业界不再需要空中楼阁式的“纸面算力”,而是需要能扎根真实业务场景、安全稳定吐出 Token 的基础设施。
 
通过将算力解构为“Agent to Token”的串联系统,海光信息清晰展现了国产算力领军者的战术定力——不盲目跟风堆砌算力峰值,而是立足芯片平台的均衡性,借由 CPU与 DCU 的深度协同打破性能瓶颈,以开放、安全的云边端方案赋能实体产业。
 
当计算重新回归业务本质,以海光为代表的国产算力生态,正迎来从“可用”走向“好用”、从“被动替代”走向“主动赋能”的全新时代。
责任编辑:duqin

相关文章

半导体行业观察
摩尔芯闻

热门评论