从“堆算力”到“用算力”:AI下半场,CPU、端侧计算与芯片安全正在被重新定义
2026-07-23
11:07:41
来源: 杜芹
点击
当生成式人工智能从大模型对话走向智能体应用,算力产业正在经历一次比硬件升级更深层的范式迁移。
7月9日至11日,以“智算无界,范式跃迁”为主题的光合组织2026智能计算应用大会在郑州举行。会后,海光信息副总裁应志伟,海光信息总裁助理、创新产品线总经理李成,海光信息服务器产品部总经理张攀勇以及光合组织嵌入式产品专家张考华接受了媒体采访。
从几位受访者释放的信息来看,当前AI产业的变化已经不再只是GPU数量、模型参数或者算力峰值的增长,而是计算负载、基础设施形态和产业价值链的重新分配:一方面,智能体正在把人工智能从内容生成工具转变为能够参与生产流程的执行系统;另一方面,CPU、端侧芯片、嵌入式计算和芯片级安全的重要性正在同步上升。
这也意味着,AI算力竞争正在从建设多少算力,逐渐转向如何让算力进入业务。
Agent推动AI从“回答问题”走向“完成任务”
过去几年,大模型应用主要集中在聊天、搜索、内容生成等交互场景,模型的核心能力是理解问题并生成答案。但随着Agent,也就是智能体技术的发展,人工智能开始具备任务拆解、工具调用、流程编排、数据处理、记忆管理和结果反馈等能力。
应志伟认为,Agent带来的关键变化,是人工智能开始真正进入生产实践。过去被认为高度专业化的编程、数据分析和内容制作等工作,正在被大模型和智能体重新组织。其影响不再局限于互联网产品,而会进一步进入金融、教育、科研以及企业内部流程。
这种变化也在扩大算力需求的边界。训练更大规模的模型仍然需要集中式计算资源,但当智能体被部署到千行百业之后,每一次任务调用、数据整理、工具执行和业务决策,都会产生新的推理、存储和通用计算需求。
因此,未来算力需求的增长不只来自模型参数继续扩大,还来自AI调用频率、业务流程复杂度和应用覆盖范围的提升。
从这个角度看,智能体并没有结束算力基础设施的建设周期,反而把算力需求从少数模型训练中心扩散到了更广泛的应用系统。
CPU重新回到AI计算体系的中心位置
在此前的大模型训练阶段,GPU几乎成为AI算力的代名词。但进入智能体时代之后,AI系统需要完成的工作已经远远超出矩阵计算和模型推理。
张攀勇指出,在智能体工作负载中,大量任务实际上需要由CPU完成,包括任务编排、工具调用、沙箱运行、数据库访问、存储管理、向量计算以及长期记忆维护等。GPU依然负责模型推理等高度并行的计算任务,但CPU开始承担整个智能体系统的控制、调度和通用计算工作。
这种负载结构的变化,正在改变数据中心内部CPU与GPU的配置关系。
在传统GPU服务器中,常见的配置可能是一颗或两颗CPU连接八颗GPU,CPU与GPU的数量比例大致为1∶4或者1∶8。但随着沙箱、数据库、向量检索、存储系统和Agent编排服务不断进入AI基础设施,海光观察到,在部分数据中心场景中,CPU与GPU的总体数量关系已经开始接近1∶1。
这并不意味着CPU将取代GPU,而是AI系统正在从以单一加速计算为中心,转向异构计算资源协同。
未来AI基础设施的竞争力,将不再由某一类芯片单独决定,而取决于CPU、GPU、互联芯片、存储和软件生态能否形成高效配合。CPU需要提供通用计算能力、调度能力、安全能力和生态兼容性,GPU则继续承担大规模并行计算和模型推理任务。
海光提出的“双芯驱动”,本质上也是希望通过CPU与GPU的紧密协同,构建覆盖AI训练、推理和智能体运行的计算底座。
算力不会只存在于数据中心
如果说大模型训练推动了云端算力基础设施的扩张,那么应用落地则正在推动算力向边缘和终端下沉。
应志伟认为,大型算力中心仍将长期承担超大模型训练、高性能推理以及复杂任务处理,但不同应用对模型规模、计算性能和实时性的要求并不相同。
例如,编程智能体可能需要千亿级甚至更大规模的模型,但人脸识别、电源波形检测、家庭教育、智能眼镜和工业设备监测等场景,并不一定需要调用超大模型。对于这些任务,参数规模更小的行业模型或端侧模型,往往能够以更低延迟、更低成本完成处理。
尤其是在网络连接不稳定、数据不能上传或者需要实时响应的场景中,本地计算的重要性更加突出。智能眼镜记录会议并生成纪要、摄像头完成人脸分析、工业设备识别异常波形,这些任务都可能需要在终端或边缘侧完成。
因此,未来AI计算不会只发生在大型机房,也会进入手机、手表、眼镜、机器人、工业控制设备和各类嵌入式系统。
张考华将嵌入式计算比作计算体系中的“毛细血管”和“末梢神经”。如果服务器和云计算中心承担集中式计算功能,那么嵌入式设备则负责感知现场、处理局部数据并连接具体业务。
这种泛在性也决定了端侧算力市场具有高度碎片化和异构化的特征。不同行业需要不同的计算性能、功耗、接口、操作系统、模型和安全等级,难以依靠一款通用芯片覆盖所有场景。
海光表示,公司推进嵌入式产品线布局,希望形成覆盖云、边、端的算力体系。
端侧AI的难点不只是“做一颗芯片”
与服务器和工作站市场相比,嵌入式市场的复杂性在于客户数量更多、产品形态更分散、行业标准更不统一。
服务器和工作站市场通常由相对集中的OEM、ODM厂商主导,而嵌入式市场可能涉及数百甚至上千家设备企业,板卡形态、接口标准和应用需求差异明显。芯片厂商不仅要判断市场需要怎样的算力,还要决定产品应该适配哪些操作系统、模型框架和行业软件。
AI的进入,又进一步改变了传统嵌入式产品的开发方式。
过去,硬件工程师更换一块计算板卡时,主要关注操作系统、接口和传统应用能否运行。但在AI设备中,硬件设计必须提前考虑未来运行什么模型、模型如何分层部署、需要怎样的端侧算力、内存容量和内存带宽。
这意味着,端侧AI产品需要从传统的“硬件选型”,走向模型、芯片、内存、软件和场景的协同设计。
对于芯片厂商而言,仅仅提供处理器已经不足以支持端侧AI规模化落地,还需要与OEM、ODM、算法企业、操作系统厂商和行业应用开发者共同建设生态。
海光的应对策略,是在内部设置产品线和生态支撑团队,同时借助头部OEM、ODM企业向更广泛的行业客户辐射。
AI for Science凸显CPU的不可替代性
除了智能体,AI for Science也是当前算力产业的重要应用方向。
蛋白质折叠、气象预测、材料计算等科学计算任务,往往同时包含大规模数据处理、复杂逻辑调度和高精度浮点运算,不能简单等同于大语言模型推理。
李成将AI加速卡比作高速运输工具,而CPU则更像复杂物流系统中的综合管理者。科学计算系统不仅要完成计算,还要处理数据输入、数据分流、存储、展示以及多个计算环节之间的交互。
在海光看来,CPU在AI for Science中至少承担三类关键任务。
首先是数据管理与吞吐。气象计算、蛋白质折叠等任务会产生和处理大量数据,需要CPU承担前期分流、综合运算和系统调度。
其次是高精度计算。大语言模型大量采用FP16、INT8等较低精度数据格式,而部分科学计算任务仍然需要FP64双精度运算,CPU的高精度浮点能力因此具有重要价值。
第三是软件生态兼容。科研院所往往积累了大量小众软件、传统工具链和既有硬件系统,处理器能否兼容原有生态,会直接影响迁移成本和部署效率。海光C86架构强调对传统x86软件生态的兼容,意在降低科研计算平台的迁移门槛。
国产化进入“先进替代”阶段
早期国产化替代,用户关注的是产品能否使用、系统能否迁移、供应链是否安全可靠。进入当前阶段后,客户开始要求国产平台不仅“可用”,还要“好用”,甚至能够提供海外供应商难以提供的附加价值。
应志伟将这一阶段称为“先进替代”。
其含义是,国产芯片不再只是复制或替换原有产品,而是通过本地化服务、系统改造、安全升级和新技术迁移,为客户创造新的价值。例如,海光正在与部分运营商、金融机构开展系统改造和抗量子迁移等工作。
这意味着,国产计算产业的竞争逻辑正在从供应链替代,逐步转向产品能力、服务能力和系统创新能力的综合竞争。
对于金融、电信、科研等关键行业而言,处理器性能仍然重要,但生态适配、安全机制、定制能力和长期服务能力正在成为更重要的采购依据。
AI放大安全风险,安全能力必须下沉到芯片
当人工智能进入生产系统之后,安全问题也被进一步放大。
一方面,大模型可以阅读和分析大量代码,自动发现潜在漏洞,攻击者挖掘漏洞的效率可能显著提升;另一方面,传统漏洞修复仍然依赖安全人员理解问题、复现攻击并完成软件修补,防御速度可能难以同步提高。
应志伟认为,在这种情况下,仅依赖软件层防护已经不足以应对AI时代的安全挑战,安全能力必须进一步下沉到硬件和芯片层。
与软件相比,硬件具有更强的固化性和不可篡改性。攻击者可以修改软件、替换代码或者利用操作系统漏洞,但很难直接改变芯片内部已经固化的安全机制。
在CPU和GPU中植入可信根、密码模块、密钥管理、机密计算和控制流保护等能力,可以为上层软件提供更加稳定的安全边界。
尤其是在云边端协同的体系中,端侧设备数量庞大、部署环境复杂,并且可能直接连接工业设备、交通系统或机器人。一旦端侧设备被攻击,风险可能从单一终端扩散至整个业务系统。
因此,随着AI向嵌入式和端侧渗透,芯片级安全不再只是服务器和数据中心的附加功能,而会成为端侧AI规模化部署的基础条件。
写在最后
从此次群访释放的信息来看,AI算力产业正在从上半场的基础设施建设,进入下半场的应用落地。
在上半场,行业关注GPU数量、模型规模、算力峰值和数据中心建设速度;进入下半场之后,决定产业竞争力的因素将更加复杂:CPU能否支撑智能体编排,GPU能否高效完成推理,互联和存储能否承载数据流动,端侧芯片能否进入具体设备,生态能否覆盖碎片化行业,安全能力能否下沉到硬件。
算力本身不会消失,也不会简单变得像传统水电一样完全同质化。它将以云端大模型、边缘服务器和端侧智能设备等多种形态存在,并根据不同业务对模型规模、实时性、成本和安全的要求进行分层部署。
对于国产计算产业而言,真正的机会也不只是替代某一款海外芯片,而是建立从CPU、GPU、NPU、互联芯片到操作系统、模型框架和行业应用的完整计算体系。
7月9日至11日,以“智算无界,范式跃迁”为主题的光合组织2026智能计算应用大会在郑州举行。会后,海光信息副总裁应志伟,海光信息总裁助理、创新产品线总经理李成,海光信息服务器产品部总经理张攀勇以及光合组织嵌入式产品专家张考华接受了媒体采访。
从几位受访者释放的信息来看,当前AI产业的变化已经不再只是GPU数量、模型参数或者算力峰值的增长,而是计算负载、基础设施形态和产业价值链的重新分配:一方面,智能体正在把人工智能从内容生成工具转变为能够参与生产流程的执行系统;另一方面,CPU、端侧芯片、嵌入式计算和芯片级安全的重要性正在同步上升。
这也意味着,AI算力竞争正在从建设多少算力,逐渐转向如何让算力进入业务。
Agent推动AI从“回答问题”走向“完成任务”
过去几年,大模型应用主要集中在聊天、搜索、内容生成等交互场景,模型的核心能力是理解问题并生成答案。但随着Agent,也就是智能体技术的发展,人工智能开始具备任务拆解、工具调用、流程编排、数据处理、记忆管理和结果反馈等能力。
应志伟认为,Agent带来的关键变化,是人工智能开始真正进入生产实践。过去被认为高度专业化的编程、数据分析和内容制作等工作,正在被大模型和智能体重新组织。其影响不再局限于互联网产品,而会进一步进入金融、教育、科研以及企业内部流程。
这种变化也在扩大算力需求的边界。训练更大规模的模型仍然需要集中式计算资源,但当智能体被部署到千行百业之后,每一次任务调用、数据整理、工具执行和业务决策,都会产生新的推理、存储和通用计算需求。
因此,未来算力需求的增长不只来自模型参数继续扩大,还来自AI调用频率、业务流程复杂度和应用覆盖范围的提升。
从这个角度看,智能体并没有结束算力基础设施的建设周期,反而把算力需求从少数模型训练中心扩散到了更广泛的应用系统。
CPU重新回到AI计算体系的中心位置
在此前的大模型训练阶段,GPU几乎成为AI算力的代名词。但进入智能体时代之后,AI系统需要完成的工作已经远远超出矩阵计算和模型推理。
张攀勇指出,在智能体工作负载中,大量任务实际上需要由CPU完成,包括任务编排、工具调用、沙箱运行、数据库访问、存储管理、向量计算以及长期记忆维护等。GPU依然负责模型推理等高度并行的计算任务,但CPU开始承担整个智能体系统的控制、调度和通用计算工作。
这种负载结构的变化,正在改变数据中心内部CPU与GPU的配置关系。
在传统GPU服务器中,常见的配置可能是一颗或两颗CPU连接八颗GPU,CPU与GPU的数量比例大致为1∶4或者1∶8。但随着沙箱、数据库、向量检索、存储系统和Agent编排服务不断进入AI基础设施,海光观察到,在部分数据中心场景中,CPU与GPU的总体数量关系已经开始接近1∶1。
这并不意味着CPU将取代GPU,而是AI系统正在从以单一加速计算为中心,转向异构计算资源协同。
未来AI基础设施的竞争力,将不再由某一类芯片单独决定,而取决于CPU、GPU、互联芯片、存储和软件生态能否形成高效配合。CPU需要提供通用计算能力、调度能力、安全能力和生态兼容性,GPU则继续承担大规模并行计算和模型推理任务。
海光提出的“双芯驱动”,本质上也是希望通过CPU与GPU的紧密协同,构建覆盖AI训练、推理和智能体运行的计算底座。
算力不会只存在于数据中心
如果说大模型训练推动了云端算力基础设施的扩张,那么应用落地则正在推动算力向边缘和终端下沉。
应志伟认为,大型算力中心仍将长期承担超大模型训练、高性能推理以及复杂任务处理,但不同应用对模型规模、计算性能和实时性的要求并不相同。
例如,编程智能体可能需要千亿级甚至更大规模的模型,但人脸识别、电源波形检测、家庭教育、智能眼镜和工业设备监测等场景,并不一定需要调用超大模型。对于这些任务,参数规模更小的行业模型或端侧模型,往往能够以更低延迟、更低成本完成处理。
尤其是在网络连接不稳定、数据不能上传或者需要实时响应的场景中,本地计算的重要性更加突出。智能眼镜记录会议并生成纪要、摄像头完成人脸分析、工业设备识别异常波形,这些任务都可能需要在终端或边缘侧完成。
因此,未来AI计算不会只发生在大型机房,也会进入手机、手表、眼镜、机器人、工业控制设备和各类嵌入式系统。
张考华将嵌入式计算比作计算体系中的“毛细血管”和“末梢神经”。如果服务器和云计算中心承担集中式计算功能,那么嵌入式设备则负责感知现场、处理局部数据并连接具体业务。
这种泛在性也决定了端侧算力市场具有高度碎片化和异构化的特征。不同行业需要不同的计算性能、功耗、接口、操作系统、模型和安全等级,难以依靠一款通用芯片覆盖所有场景。
海光表示,公司推进嵌入式产品线布局,希望形成覆盖云、边、端的算力体系。
端侧AI的难点不只是“做一颗芯片”
与服务器和工作站市场相比,嵌入式市场的复杂性在于客户数量更多、产品形态更分散、行业标准更不统一。
服务器和工作站市场通常由相对集中的OEM、ODM厂商主导,而嵌入式市场可能涉及数百甚至上千家设备企业,板卡形态、接口标准和应用需求差异明显。芯片厂商不仅要判断市场需要怎样的算力,还要决定产品应该适配哪些操作系统、模型框架和行业软件。
AI的进入,又进一步改变了传统嵌入式产品的开发方式。
过去,硬件工程师更换一块计算板卡时,主要关注操作系统、接口和传统应用能否运行。但在AI设备中,硬件设计必须提前考虑未来运行什么模型、模型如何分层部署、需要怎样的端侧算力、内存容量和内存带宽。
这意味着,端侧AI产品需要从传统的“硬件选型”,走向模型、芯片、内存、软件和场景的协同设计。
对于芯片厂商而言,仅仅提供处理器已经不足以支持端侧AI规模化落地,还需要与OEM、ODM、算法企业、操作系统厂商和行业应用开发者共同建设生态。
海光的应对策略,是在内部设置产品线和生态支撑团队,同时借助头部OEM、ODM企业向更广泛的行业客户辐射。
AI for Science凸显CPU的不可替代性
除了智能体,AI for Science也是当前算力产业的重要应用方向。
蛋白质折叠、气象预测、材料计算等科学计算任务,往往同时包含大规模数据处理、复杂逻辑调度和高精度浮点运算,不能简单等同于大语言模型推理。
李成将AI加速卡比作高速运输工具,而CPU则更像复杂物流系统中的综合管理者。科学计算系统不仅要完成计算,还要处理数据输入、数据分流、存储、展示以及多个计算环节之间的交互。
在海光看来,CPU在AI for Science中至少承担三类关键任务。
首先是数据管理与吞吐。气象计算、蛋白质折叠等任务会产生和处理大量数据,需要CPU承担前期分流、综合运算和系统调度。
其次是高精度计算。大语言模型大量采用FP16、INT8等较低精度数据格式,而部分科学计算任务仍然需要FP64双精度运算,CPU的高精度浮点能力因此具有重要价值。
第三是软件生态兼容。科研院所往往积累了大量小众软件、传统工具链和既有硬件系统,处理器能否兼容原有生态,会直接影响迁移成本和部署效率。海光C86架构强调对传统x86软件生态的兼容,意在降低科研计算平台的迁移门槛。
国产化进入“先进替代”阶段
早期国产化替代,用户关注的是产品能否使用、系统能否迁移、供应链是否安全可靠。进入当前阶段后,客户开始要求国产平台不仅“可用”,还要“好用”,甚至能够提供海外供应商难以提供的附加价值。
应志伟将这一阶段称为“先进替代”。
其含义是,国产芯片不再只是复制或替换原有产品,而是通过本地化服务、系统改造、安全升级和新技术迁移,为客户创造新的价值。例如,海光正在与部分运营商、金融机构开展系统改造和抗量子迁移等工作。
这意味着,国产计算产业的竞争逻辑正在从供应链替代,逐步转向产品能力、服务能力和系统创新能力的综合竞争。
对于金融、电信、科研等关键行业而言,处理器性能仍然重要,但生态适配、安全机制、定制能力和长期服务能力正在成为更重要的采购依据。
AI放大安全风险,安全能力必须下沉到芯片
当人工智能进入生产系统之后,安全问题也被进一步放大。
一方面,大模型可以阅读和分析大量代码,自动发现潜在漏洞,攻击者挖掘漏洞的效率可能显著提升;另一方面,传统漏洞修复仍然依赖安全人员理解问题、复现攻击并完成软件修补,防御速度可能难以同步提高。
应志伟认为,在这种情况下,仅依赖软件层防护已经不足以应对AI时代的安全挑战,安全能力必须进一步下沉到硬件和芯片层。
与软件相比,硬件具有更强的固化性和不可篡改性。攻击者可以修改软件、替换代码或者利用操作系统漏洞,但很难直接改变芯片内部已经固化的安全机制。
在CPU和GPU中植入可信根、密码模块、密钥管理、机密计算和控制流保护等能力,可以为上层软件提供更加稳定的安全边界。
尤其是在云边端协同的体系中,端侧设备数量庞大、部署环境复杂,并且可能直接连接工业设备、交通系统或机器人。一旦端侧设备被攻击,风险可能从单一终端扩散至整个业务系统。
因此,随着AI向嵌入式和端侧渗透,芯片级安全不再只是服务器和数据中心的附加功能,而会成为端侧AI规模化部署的基础条件。
写在最后
从此次群访释放的信息来看,AI算力产业正在从上半场的基础设施建设,进入下半场的应用落地。
在上半场,行业关注GPU数量、模型规模、算力峰值和数据中心建设速度;进入下半场之后,决定产业竞争力的因素将更加复杂:CPU能否支撑智能体编排,GPU能否高效完成推理,互联和存储能否承载数据流动,端侧芯片能否进入具体设备,生态能否覆盖碎片化行业,安全能力能否下沉到硬件。
算力本身不会消失,也不会简单变得像传统水电一样完全同质化。它将以云端大模型、边缘服务器和端侧智能设备等多种形态存在,并根据不同业务对模型规模、实时性、成本和安全的要求进行分层部署。
对于国产计算产业而言,真正的机会也不只是替代某一款海外芯片,而是建立从CPU、GPU、NPU、互联芯片到操作系统、模型框架和行业应用的完整计算体系。
责任编辑:duqin
相关文章
-
- 半导体行业观察
-
- 摩尔芯闻