NVIDIA发布Groq 3 LPX,开启Agentic AI新时代

2026-08-26 17:33:51 来源: 杜芹
点击
AI算力的竞争,正在出现一个越来越明显的变化。
 
过去几年,整个产业讨论最多的是如何训练更大的模型:GPU数量能否继续增加,HBM带宽能否跟上,Scale-up和Scale-out网络能否支撑十万卡甚至百万卡集群。但随着大模型从训练走向推理,再进一步进入Agentic AI时代,另一个过去没有那么突出的指标正在迅速变得重要——一个AI系统究竟能以多快的速度连续生成Token。
 
8月24日,在2026 Hot Chips大会上,NVIDIA宣布,用于交互式AI推理的硬件加速器 NVIDIA Groq 3 LPX已全面进入量产阶段。作为全新Vera Rubin架构平台的关键延伸,Groq 3 LPX旨在突破智能体AI面临的“首要瓶颈”——Token生成延迟,以极速的响应能力重新定义算力工厂的产出效率。


 
Nebius成为首家采用Groq 3 LPX的AI云服务商;与此同时,CoreWeave已经部署Spectrum-X Multiplane,SpaceXAI则宣布采用Vera CPU。几项看似分散的产品和客户进展,实际上共同指向NVIDIA正在推动的一次基础设施变化:Agentic AI时代需要的已经不只是更强的GPU,而是一套围绕Token生产效率重新设计的AI工厂。
 
Agentic AI 时代,推理成了“新战场”
 
在过去的LLM时代,算力竞争的核心在于模型训练;但在 Agentic AI 时代,推理成了决定商业生死的新极限。
 
智能体系统在执行如自主编程、数据分析或多步骤决策等复杂任务时,并非生成单次回答,而是在长达数分钟甚至数小时的执行链中,连续跨数百或数千个推理步骤生成海量的 Token。这一过程带来了两大严峻的计算挑战:
 
1)海量上下文吞吐:智能体需要同时读取并分析超长代码库或文档。
 
2)极低的解码延迟:智能体在推理、调用外部 API及自我验证时,Token是一逐一生成的。任何微小的单Token延迟,在长链路自回归推理中都会被成倍放大,最终导致用户体验从“实时交互”退化为“长时间等待”。
 
Agentic AI正在迫使AI基础设施同时优化两个过去经常被混为一谈的指标:Throughput,决定整座AI工厂每秒能够生产多少Token;Interactivity,则决定单个用户、单个Agent能够以多快的速度获得下一枚Token。Groq 3 LPX主要针对的,正是后者。
 
“推理是AI发展的增长引擎。”黄仁勋在发布会上指出,“Grace Blackwell和NVL72曾带来了性能与效率的前所未有的飞跃;而Vera Rubin架构则将这一愿景延伸至Agentic AI时代——通过LPX实现极速Token生成,将智能体的响应速度提升到全新高度。”
 
Groq 3 LPX如何破局“解码延迟”?
 
2025年12月,NVIDIA与Groq达成了一项非独家推理技术授权协议。Groq创始人Jonathan Ross、总裁Sunny Madra以及部分团队成员随后加入NVIDIA,而Groq本身继续作为独立公司运营。
 
不到一年之后,这项技术已经被真正嵌入NVIDIA下一代AI平台。
 
Groq的核心思路与GPU存在明显不同。传统GPU拥有复杂的硬件调度、缓存和大量通用计算能力,优势是能够适应非常广泛的工作负载;Groq LPU则更加激进,它把确定性执行、编译器调度以及SRAM优先的存储架构放到了中心位置。
 
Groq 3 LPX采用编译器预先规划工作负载执行过程。编译器能够看到系统中256颗LP30 LPU的计算资源、总计128GB SRAM以及芯片之间的C2C连接,并在任务真正开始之前,对计算和数据传输进行细粒度调度,从而减少运行期间动态仲裁带来的不确定性。
 
按照NVIDIA公布的数据,在Artificial Analysis基准测试中,Groq 3 LPX运行开源智能体模型Gemma 4 31B、处理10万Token长上下文时,实现了3400 Output Tokens/s,创下该模型当时的最快纪录;在智能体和延迟敏感型工作负载上,其响应速度达到最接近替代平台的4倍。
 
Groq 3 LPX并不是一套试图替代GPU的独立推理系统。相反,NVIDIA正在让GPU和LPU共同完成推理。
 
在Vera Rubin体系中,Rubin GPU继续承担长上下文Prefill以及Decode阶段的Attention计算,而LPX则加速对延迟更加敏感的FFN和MoE Expert执行。NVIDIA Dynamo负责识别和调度请求,把不同类型的工作负载分配到更合适的计算资源上。
 
在更大规模部署中,一套机架级Groq 3 LPX可以包含256颗LP30加速器,通过直接的C2C互连协同运行,形成一个针对确定性推理优化的大型处理器。
 
这背后透露出的变化非常重要。过去讨论GPU与ASIC时,行业很容易把问题简化成“通用GPU和专用芯片谁最终会赢”。但Agentic AI正在给出另一个答案:它们可能根本不是替代关系,而是分工关系。GPU负责大规模、高并行度和通用性更强的计算;LPU负责对Token延迟高度敏感的特定推理阶段;CPU处理工具调用、代码执行和任务编排;DPU负责网络、存储、安全与基础设施服务。
 
真正需要被优化的,已经不再是一颗芯片,而是一枚Token在整个AI工厂中的完整生产过程。这正是NVIDIA最近不断强调的“Extreme Codesign”,即极致协同设计。
 
全栈演进:构筑“Token工厂”的四大底层支柱
 
为了支撑Agentic AI所需的庞大吞吐与极低时延,英伟达在Hot Chips 2026上展现的不仅是一颗芯片的突破,而是贯穿计算、网络、存储与系统集成的全栈基础设施重构。
 
传统数据中心习惯用FLOPS、GPU数量或者算力利用率衡量基础设施。但在NVIDIA最新的AI Factory框架中,一座AI工厂最终交付的是智能,因此真正决定商业效率的指标正在变成:Tokens/s、Tokens/W、Cost per Token、Utilization以及Uptime。
 
也就是说,重点不再只是拥有多少算力,而是这些算力最终能够以多低的成本、多高的效率持续生产多少Token。
 
围绕这个目标,NVIDIA正在补齐至少四块基础设施。
 
第一块:Groq 3 LPX——解决Token生成延迟
 
Groq 3 LPX主要解决Token生成阶段的Interactivity问题。Rubin GPU提供强大的上下文处理和大规模计算能力,LPX则通过确定性架构和高速Token生成能力降低解码延迟。
 
第二块:Vera CPU——Agent不只是推理,还要真正“做事”
 
Agentic AI与传统大模型最大的区别之一,是它不仅生成答案,还必须执行动作。调用工具、执行代码、处理数据、运行模拟以及协调不同任务,本质上都会产生大量CPU工作负载。
 
这也是Vera CPU开始变得重要的原因。
 
NVIDIA Vera拥有88个Olympus核心以及最高1.2TB/s的LPDDR5X内存带宽。NVIDIA表示,在Agentic AI、强化学习和数据处理等工作负载中,其任务完成速度相较传统x86 CPU最高可提升1.8倍。SpaceXAI已经宣布将在下一代Agentic AI基础设施中采用Vera CPU。
 
这背后体现的仍然是同一个逻辑:让GPU专注于GPU最擅长的事情,同时把代码执行、数据处理和Agent编排交给更适合的CPU。
 
第三块:Spectrum-X Multiplane——让AI工厂继续向数十万卡扩张
 
随着AI工厂从几万颗GPU继续向数十万颗甚至更大规模扩展,网络本身已经成为影响Token生产效率的重要因素。
 
传统大型集群继续扩张时,往往需要增加第三层网络,但随之而来的不仅是更多交换设备,还包括更多光模块、线缆、功耗以及额外延迟。
 
Spectrum-X Multiplane采用了另一种思路。它把服务器网络连接拆分成多个彼此独立的Plane,每个Plane继续保持相对简单的两层网络结构,从而在不增加第三层网络的情况下扩展集群。
 
按照NVIDIA公布的数据,这套架构可以扩展至51.2万颗GPU;在八Plane拓扑下,即使其中一个Plane发生故障,系统仍能够保持大约90%的总带宽,硬件级恢复速度达到软件多平面负载均衡的11倍,并可使AI工厂整体产出提高1.6倍。
 
第四块:Scale-In与NVLink Fusion
 
NVIDIA此次还在继续向AI工厂更外围的基础设施扩张。
 
其中,Scale-In被NVIDIA定义为AI网络体系的第五大支柱。它基于BlueField-4和DOCA,把多租户网络、高性能存储访问、硬件安全、弹性资源配置以及实时可观测能力从Host计算资源中剥离出来,使基础设施服务能够随着GPU和Agent规模同步扩展。
 
另一方面,NVLink Fusion则代表了NVIDIA完全不同的一种开放策略。
 
随着Google、AWS、Meta等大型云厂商不断开发自己的ASIC和XPU,NVIDIA已经很难要求未来所有AI工厂都只使用GPU。于是它选择把NVLink、Vera CPU、MGX机架、散热、供电、网络以及软件基础设施向XPU开放。
 
第六代NVLink可以构建72颗XPU的高速互连域;NVLink-C2C则可以连接XPU与Vera CPU或者其他生态CPU。基于NVLink Fusion,XPU和GPU系统还能够共用机架空间、网络、散热、供电和管理体系。


 
这意味着,即便未来一部分AI计算转向定制ASIC,NVIDIA仍然希望掌握ASIC之外的大部分AI工厂基础设施。从这个角度看,NVLink Fusion甚至可以被理解为NVIDIA对“后GPU时代”的提前布局:如果客户一定要造自己的芯片,那么NVIDIA就试图让这些芯片运行在自己的AI工厂里。
 
结语
 
NVIDIA Groq 3 LPX 的量产,标志着 AI 算力产业的范式转移:基础设施的衡量标准,已从单芯片算力峰值全面转向Token 的生成速度与单位成本效益。
 
通过将Groq 3 LPX的极速解码性能、Vera Rubin NVL72的强大吞吐量、Spectrum-X Multiplane的扁平化网络扩展,以及Scale-In / NVLink Fusion的生态包容力深度融合,英伟达正在将传统数据中心重塑为高效生产“数字智能”的工业化工厂。Agentic AI的时代,正式驶入快车道。
责任编辑:duqin

相关文章

半导体行业观察
摩尔芯闻

热门评论