RISC-V+数据流,国产芯片的换道突围之路
2026-09-22
08:20:00
来源: 李晨光
点击
2026年被业界公认为“具身智能元年”,物理AI正推动人工智能从数字世界迈向物理世界。据预测,2026年全球物理AI市场规模将达3830亿美元,2040年突破3.26万亿美元。中国工程院院士倪光南指出,当前人工智能正加速从数字世界迈向物理世界,2026年全球科技巨头将集体转向物理AI。
物理AI的核心是让智能体在真实环境中完成感知、决策、行动的闭环——这对端侧算力提出了极为苛刻的要求:既要运行大模型实现环境理解与任务规划,又要满足实时运动控制的低延迟,还要在功耗受限的机器人本体上实现长时续航。
然而,当前主流的GPU架构在应对这一需求时显得力不从心。在一颗现代AI大芯片中,真正消耗在计算上的能量往往不到20%,剩下超过80%都浪费在了数据搬运的路上——从内存到缓存、从缓存到寄存器、再从寄存器搬回计算单元,数据每往返一次,能耗就是计算本身的数十倍。
这就是冯·诺依曼架构与生俱来的“存储墙”瓶颈。在云端数据中心,还可以靠堆HBM带宽、堆供电散热来掩盖问题;但当AI走向物理世界,物理AI场景要求低延迟、低功耗、实时性与确定性执行,而这些恰恰是传统架构的弱项。
正是在这一背景下,数据流架构正在从学术圈走向产业中央。
2025年12月,英伟达以约200亿美元与Groq达成技术授权协议,获得其AI推理技术知识产权并吸纳核心高管团队。Groq的语言处理单元(LPU)在AI推理任务中实现了约10倍于GPU的性能突破。与此同时,英特尔也拟以16亿美元将数据流架构芯片公司SambaNova收入囊中。
这两笔合计超210亿美元的并购大案,并非寻常的商业布局,而是对下一代计算架构的集体押注。正如业界所指出的:数据流架构,这个沉寂数十年的技术方向,正迸发出新的生机。
全球数据流AI处理器市场规模的增长同样印证了这一趋势。根据Global Market Insights的报告,2024年全球数据流AI处理器市场规模已达到52亿美元,预计到2034年将达到147亿美元,年复合增长率为11.1%。
要理解数据流架构为何在物理AI时代备受关注,需要回到计算机体系结构最底层的范式之争。
自1945年冯·诺依曼提出存储程序架构以来,CPU与GPU始终遵循着“程序计数器+共享内存”的核心逻辑。在控制流架构下,所有指令必须在程序计数器的指挥下按部就班执行。但现代处理器的计算速度已远超数据访问速度,处理器大部分时间在等待数据,传统控制流架构的“存储墙”显著制约了算力提升的上限。
苏州睿芯创始人范东睿用一个生动的类比来解释两种架构的本质差异:“控制流就像计划经济,资源规模小、目标单一的时候效率最高;但规模大、场景复杂的时候,市场经济的资源配置效率更高。数据流就是让数据准备好就自动触发计算,需要做加法就做加法,需要做乘法就做乘法,不需要中央统一调度。就像市场经济里看不见的手,靠数据依赖关系驱动执行,整体效率更高,但设计复杂度也指数级上升。”
数据流架构的核心原理可以概括为“数据就绪即执行,数据流过即计算”:数据就绪自动触发计算,结果直接沿依赖链路流向下游节点,类似市场经济,资源自动配置,整体效率更高,但设计复杂度呈指数级上升。
实际上,数据流架构并不是新概念。早在上世纪60年代,MIT的Jack Dennis教授就提出了数据驱动计算的思想。但在诞生后的近60年里,数据流架构长期停留在实验室,没有走向大规模商业化。
在范东睿看来,核心原因在于两个“错配”:
· 场景错配:早年数据流都尝试用在通用CPU设计和超级计算机上:通用CPU对灵活性要求极高,数据流的设计难度、编程难度被无限放大,很难落地;超级计算机应用场景又太窄,只有天体模拟、气象模拟等少数领域,撑不起产业规模。
· 需求错配:没有足够强的算力,也没有足够强的AI需求。数据流的优势要在大规模并行、高复用的计算场景下才会释放,而在AI爆发之前,没有这样的普遍需求。
而数据流最近几年之所以开始走向商业化。范东睿认为,这是技术条件与市场需求双重驱动的结果。
一方面,摩尔定律逐步逼近物理极限,制程红利快速消退,靠升级工艺提升性能的老路越走越窄,倒逼行业用架构创新替代制程红利;另一方面,AI尤其是端侧物理AI的爆发,带来了最匹配数据流特性的计算场景。 范东睿的导师、数据流架构领域的奠基人之一高光荣教授很早就提出:AI和数据流是天然匹配的,做数据流一定要走领域专用路线,围绕一个确定性的领域去做设计,不能追求通用设计。
当AI从云端走向物理世界,场景的变化进一步放大了数据流的优势。物理AI不拼峰值算力,拼的是混合负载下的有效算力、确定性延迟和单位功耗产出,这些恰恰是传统GPU的短板,却是数据流架构的优势。
对中国芯片产业而言,数据流架构的意义还不止于技术本身,它更提供了一条“换道超车”的可能路径。
范东睿曾深度参与两次重大技术引进:海光引进AMD x86授权、贵州引进高通ARM架构,全程参与技术谈判的经历,让他对不同技术体系的区别有极深的体感。他极度认可孙凝晖院士提出的,国内芯片产业面对的是一个清晰的“ABC体系”格局这一观点:
· A体系:目前主流的x86和ARM标准,技术及生态都很成熟,但要用就要取得别人的授权,进入实体清单后,基本不能获取到最新的架构更新;
· B体系:自主的指令集体系,主要考虑安全可控,在生态发展方面受到制约;
· C体系:以RISC-V开放指令集为基础,开源开放,不受任何人的制约,结合数据流架构在物理AI场景下的应用,自主可控又能服务全球。
“从芯片的技术层面上讲,不能只防守,还要有技术输出的能力。”范东睿判断,C体系是长期必然方向,“RISC-V+数据流”正是C体系在AI芯片时代的重要载体。而工业和信息化部、国家发展改革委近期发布的《电子信息制造业发展“十五五”规划》也同时印证了这个观点, RISC-V指令集的研发与产业化,以及支持 RISC-V 芯片在人工智能、嵌入式系统等领域的应用被明确写入文件。
这一判断的背后,还有中国芯片产业的一个硬约束:制程工艺受限。国际芯片巨头采用的3nm、2nm先进工艺,对国内而言还不可能大规模采用,大部分国产芯片目前只能在7nm左右的工艺节点上做文章。如果只靠制程堆性能,基本就是走着追随者的道路,还面临生态、成本的多重差距,破局的方法之一,就是更换设计方法,靠架构创新弥补工艺差距。
正是基于这一判断,睿芯团队早在2014年就all in数据流路线。那时候GPU正风光无限,ARM架构如日中天,数据流还是学术界的冷门方向。但团队判断:底层架构的创新,才能真正突破制程瓶颈,在商业市场形成真正的竞争力。
经过十几年持续深耕,睿芯团队最终凝练成了高光D35这颗产品——全球首款RISC-V数据流物理AI芯片。它不是在传统架构上做局部优化,而是基于数据流重全栈重构,集成自研RISC-V CPU内核与数据流架构LPU,配备128GB超大显存,用12nm工艺实现了对标甚至超越国际主流7nm边缘AI芯片的性能。
一款芯片的价值,最终要落到场景里验证。高光D35的数据流架构优势,在物理AI的典型场景中,转化成了实实在在的体验差异。
数据流架构的核心优势是效率。在简单乘加运算场景,各类架构效率都能到90%以上,差异不大;但一旦进入多模型融合、多传感器处理、感知-决策-控制全链路的复杂场景,传统架构的算力利用率会暴跌到个位数。
“在复杂的多模态场景中,传统架构主流边缘芯片的算力利用率十分不尽如人意,有的甚至会跌到个位数的百分比,而数据流架构能做到60%。”范东睿表示。
具身智能就是最典型的复杂场景:同时跑视觉、听觉、运动规划多个模型,连接一堆异构传感器,还要在确定性时间内完成全部运算。传统方案要么算力全给视觉、控制就来不及,要么保证控制延迟、视觉帧率就上不去。而数据流架构下,不同模型和算法可以映射到同一张数据流图的不同路径,数据就绪就独立运行,不需要操作系统调度,也不需要上下文切换,延迟和利用率都从架构层面得到保障。
高光D35最受关注的配置之一,是单芯片128GB的大显存。在端侧芯片普遍只有几GB到几十GB显存的当下,这个配置显得格外“奢侈”。
在范东睿看来,这不是参数堆砌,而是物理AI的刚需:“就像人一样,脑容量大才能考虑更多边界条件,做出更合理的决策。机器人不是只会做预设动作,要应对开放环境的动态变化,就要有足够的模型容量和知识储备。”随着端侧大模型的普及,128GB显存的价值正在快速释放。本地数字人、医生专属知识库、工业视觉大模型...这些场景都要求模型不回传云端,在端侧本地运行。大显存加上数据流架构的高数据搬运效率,让端侧跑大模型从能用变成好用。
物理世界的计算和云端最大的不同,是延迟的确定性。云端推理慢几十毫秒用户感知不到,但机器人运动控制、自动驾驶决策、通信基带处理,差几十毫秒就可能出事故。
传统GPU的延迟是波动的:缓存命中、调度队列、Warp冲突都会带来抖动,标称延迟都是最优工况,实际运行中波动很大。而数据流架构的延迟是编译期就确定的——数据路径固定、触发条件明确,端到端延迟可预测、可控制,最坏情况执行时间(WCET)有严格保障。
这也正是D35能切入通信卫星地面接收、工业控制等强实时场景的核心原因。在这些领域,“不超时”比快更重要。
据悉,高光D35目前已经在四大核心场景完成规模化验证:
· 视频智能计算是第一大场景:占订单总量50%以上。现实世界中,摄像头产生的视频数据量巨大,硬盘价格翻了几番,存储周期要求从15天延长到3个月,成本压力极大。睿芯的解决方案是用AI做芯片级无损压缩,已在公安部拿到认证,压缩比可达10到20倍,硬盘用量减少90%,大幅降低安防、城市大脑的存储成本。
· 具身智能是增长最快的方向:约占当前订单量20%。睿芯已与启元机器人等头部企业开展合作,D35芯片在机器人场景的适配和连接效果目前测试得非常好。此外,在无人配送、安防巡逻等场景测试验证效果优异,20ms内完成路线自主纠偏,进入供货准备阶段。
· 通信与卫星接收是刚需场景:约占15%。匹配低轨卫星地面接收的确定性延迟需求,在通信基站加速场景落地。
· 本地AI与AIPC正在爆发:隐私需求推动本地AI计算。以公共场所的数字人为例,公安部门要求必须本地推理,因为游客可能有诱导性提问,本地模型可以做意图识别和内容风控,确保输出合规。
“对比国际主流边缘AI芯片,D35的功能全覆盖,接口更丰富,通信、视频处理等专项场景性能是对方的数倍,成本还更低。”范东睿透露,公司去年已经实现盈亏平衡,这在国产高端AI芯片创业公司中极为罕见,也印证了数据流路线的商业可行性。
数据流芯片最大的行业质疑,就是软件生态和编程门槛。“数据流硬件效率高,但编译器难写、开发者难用”是行业的普遍认知。
睿芯的解法很明确:不把编程负担转嫁给用户,用户用起来有负担的地方,睿芯自己来解决。
范东睿表示,公司自研了名为“丹尼斯”的自动化编译工具,名字源自高光荣教授的导师Jack Dennis,可以自动把AI模型翻译优化到D35芯片上,大幅降低底层开发工作量。在框架层面,D35和PyTorch、TensorFlow等主流AI框架完全兼容,上层应用可以直接迁移。
在生态建设上,范东睿坚持分工协作的思路:“我们本质是芯片公司,一切努力都是为了让芯片被用起来。构建生态正是表明自己不要做所有事,只要生态伙伴能承担的事情,睿芯马上就会撤出来,我们就专注把芯片做好,大家一起共赢。”为此,睿芯发起了“光荣社区”来运营开发者生态,目前已经有几十家生态合作伙伴,覆盖算法、方案、整机各个环节。
更具标志性的认可是英特尔的选择:英特尔最终选择了睿芯的自研RISC-V CPU内核IP进行全球采购,这既是对睿芯技术实力的背书,也证明了开放架构路线的国际竞争力——好的技术,不管在哪里,都会被市场认可。
对于数据流架构的未来,范东睿的判断很务实:它不会取代GPU,而是会开辟一条全新的赛道。在他看来,GPU在云端训练、通用计算场景依然不可替代,但在物理AI、边缘推理这些垂直场景,数据流架构会凭借能效和延迟优势,成为最优解。
关于未来的技术路线,睿芯的规划清晰地分为两个方向:
· 更高性能:持续提升算力、带宽、存储容量,降低延迟,支撑更复杂的场景和更大的模型,让端侧智能的上限不断提高;
· 更低功耗:推出更低功耗、更小体积的产品,适配微型、移动、电池供电的边缘场景,拓宽数据流架构的适用边界。
“芯片行业的规律是,五年前的设计决定了今天的产品。所以现在就要思考五年后市场需要什么样的芯片。”范东睿强调。
从更大的行业视角看,数据流架构的崛起,本质上是AI算力竞争的重心转移:从比拼峰值算力,转向比拼架构效率;从比拼云端规模,转向比拼端侧落地能力;从跟随别人的标准,转向走出自己的路线。
过去几十年,中国芯片产业更多是在别人的规则里追赶。而数据流与RISC-V的结合,给了行业一个换道的机会——不用在别人划定的赛道里死磕,而是在物理AI这个新赛场,用开放的架构、自主的技术,定义新的标准。
就像范东睿一直坚信的:做芯片,最终靠产品说话。当数据流架构从论文变成量产芯片,从实验室走向千行百业,这条冷了六十年的技术路线,正在迎来属于它的时代。而物理AI的真正竞赛,也才刚刚开始。
物理AI的核心是让智能体在真实环境中完成感知、决策、行动的闭环——这对端侧算力提出了极为苛刻的要求:既要运行大模型实现环境理解与任务规划,又要满足实时运动控制的低延迟,还要在功耗受限的机器人本体上实现长时续航。
然而,当前主流的GPU架构在应对这一需求时显得力不从心。在一颗现代AI大芯片中,真正消耗在计算上的能量往往不到20%,剩下超过80%都浪费在了数据搬运的路上——从内存到缓存、从缓存到寄存器、再从寄存器搬回计算单元,数据每往返一次,能耗就是计算本身的数十倍。
这就是冯·诺依曼架构与生俱来的“存储墙”瓶颈。在云端数据中心,还可以靠堆HBM带宽、堆供电散热来掩盖问题;但当AI走向物理世界,物理AI场景要求低延迟、低功耗、实时性与确定性执行,而这些恰恰是传统架构的弱项。
正是在这一背景下,数据流架构正在从学术圈走向产业中央。
一场210亿美元的“架构投票”
2025年12月,英伟达以约200亿美元与Groq达成技术授权协议,获得其AI推理技术知识产权并吸纳核心高管团队。Groq的语言处理单元(LPU)在AI推理任务中实现了约10倍于GPU的性能突破。与此同时,英特尔也拟以16亿美元将数据流架构芯片公司SambaNova收入囊中。
这两笔合计超210亿美元的并购大案,并非寻常的商业布局,而是对下一代计算架构的集体押注。正如业界所指出的:数据流架构,这个沉寂数十年的技术方向,正迸发出新的生机。
全球数据流AI处理器市场规模的增长同样印证了这一趋势。根据Global Market Insights的报告,2024年全球数据流AI处理器市场规模已达到52亿美元,预计到2034年将达到147亿美元,年复合增长率为11.1%。
从控制流到数据流:一场计算范式的根本转变
要理解数据流架构为何在物理AI时代备受关注,需要回到计算机体系结构最底层的范式之争。
自1945年冯·诺依曼提出存储程序架构以来,CPU与GPU始终遵循着“程序计数器+共享内存”的核心逻辑。在控制流架构下,所有指令必须在程序计数器的指挥下按部就班执行。但现代处理器的计算速度已远超数据访问速度,处理器大部分时间在等待数据,传统控制流架构的“存储墙”显著制约了算力提升的上限。
苏州睿芯创始人范东睿用一个生动的类比来解释两种架构的本质差异:“控制流就像计划经济,资源规模小、目标单一的时候效率最高;但规模大、场景复杂的时候,市场经济的资源配置效率更高。数据流就是让数据准备好就自动触发计算,需要做加法就做加法,需要做乘法就做乘法,不需要中央统一调度。就像市场经济里看不见的手,靠数据依赖关系驱动执行,整体效率更高,但设计复杂度也指数级上升。”
数据流架构的核心原理可以概括为“数据就绪即执行,数据流过即计算”:数据就绪自动触发计算,结果直接沿依赖链路流向下游节点,类似市场经济,资源自动配置,整体效率更高,但设计复杂度呈指数级上升。
实际上,数据流架构并不是新概念。早在上世纪60年代,MIT的Jack Dennis教授就提出了数据驱动计算的思想。但在诞生后的近60年里,数据流架构长期停留在实验室,没有走向大规模商业化。
在范东睿看来,核心原因在于两个“错配”:
· 场景错配:早年数据流都尝试用在通用CPU设计和超级计算机上:通用CPU对灵活性要求极高,数据流的设计难度、编程难度被无限放大,很难落地;超级计算机应用场景又太窄,只有天体模拟、气象模拟等少数领域,撑不起产业规模。
· 需求错配:没有足够强的算力,也没有足够强的AI需求。数据流的优势要在大规模并行、高复用的计算场景下才会释放,而在AI爆发之前,没有这样的普遍需求。
而数据流最近几年之所以开始走向商业化。范东睿认为,这是技术条件与市场需求双重驱动的结果。
一方面,摩尔定律逐步逼近物理极限,制程红利快速消退,靠升级工艺提升性能的老路越走越窄,倒逼行业用架构创新替代制程红利;另一方面,AI尤其是端侧物理AI的爆发,带来了最匹配数据流特性的计算场景。 范东睿的导师、数据流架构领域的奠基人之一高光荣教授很早就提出:AI和数据流是天然匹配的,做数据流一定要走领域专用路线,围绕一个确定性的领域去做设计,不能追求通用设计。
当AI从云端走向物理世界,场景的变化进一步放大了数据流的优势。物理AI不拼峰值算力,拼的是混合负载下的有效算力、确定性延迟和单位功耗产出,这些恰恰是传统GPU的短板,却是数据流架构的优势。
换道超车:制程约束下的中国芯选择
对中国芯片产业而言,数据流架构的意义还不止于技术本身,它更提供了一条“换道超车”的可能路径。
范东睿曾深度参与两次重大技术引进:海光引进AMD x86授权、贵州引进高通ARM架构,全程参与技术谈判的经历,让他对不同技术体系的区别有极深的体感。他极度认可孙凝晖院士提出的,国内芯片产业面对的是一个清晰的“ABC体系”格局这一观点:
· A体系:目前主流的x86和ARM标准,技术及生态都很成熟,但要用就要取得别人的授权,进入实体清单后,基本不能获取到最新的架构更新;
· B体系:自主的指令集体系,主要考虑安全可控,在生态发展方面受到制约;
· C体系:以RISC-V开放指令集为基础,开源开放,不受任何人的制约,结合数据流架构在物理AI场景下的应用,自主可控又能服务全球。
“从芯片的技术层面上讲,不能只防守,还要有技术输出的能力。”范东睿判断,C体系是长期必然方向,“RISC-V+数据流”正是C体系在AI芯片时代的重要载体。而工业和信息化部、国家发展改革委近期发布的《电子信息制造业发展“十五五”规划》也同时印证了这个观点, RISC-V指令集的研发与产业化,以及支持 RISC-V 芯片在人工智能、嵌入式系统等领域的应用被明确写入文件。
这一判断的背后,还有中国芯片产业的一个硬约束:制程工艺受限。国际芯片巨头采用的3nm、2nm先进工艺,对国内而言还不可能大规模采用,大部分国产芯片目前只能在7nm左右的工艺节点上做文章。如果只靠制程堆性能,基本就是走着追随者的道路,还面临生态、成本的多重差距,破局的方法之一,就是更换设计方法,靠架构创新弥补工艺差距。
正是基于这一判断,睿芯团队早在2014年就all in数据流路线。那时候GPU正风光无限,ARM架构如日中天,数据流还是学术界的冷门方向。但团队判断:底层架构的创新,才能真正突破制程瓶颈,在商业市场形成真正的竞争力。
经过十几年持续深耕,睿芯团队最终凝练成了高光D35这颗产品——全球首款RISC-V数据流物理AI芯片。它不是在传统架构上做局部优化,而是基于数据流重全栈重构,集成自研RISC-V CPU内核与数据流架构LPU,配备128GB超大显存,用12nm工艺实现了对标甚至超越国际主流7nm边缘AI芯片的性能。
D35:一颗为物理AI而生的数据流芯片
一款芯片的价值,最终要落到场景里验证。高光D35的数据流架构优势,在物理AI的典型场景中,转化成了实实在在的体验差异。
1、复杂场景下的效率革命
数据流架构的核心优势是效率。在简单乘加运算场景,各类架构效率都能到90%以上,差异不大;但一旦进入多模型融合、多传感器处理、感知-决策-控制全链路的复杂场景,传统架构的算力利用率会暴跌到个位数。
“在复杂的多模态场景中,传统架构主流边缘芯片的算力利用率十分不尽如人意,有的甚至会跌到个位数的百分比,而数据流架构能做到60%。”范东睿表示。
具身智能就是最典型的复杂场景:同时跑视觉、听觉、运动规划多个模型,连接一堆异构传感器,还要在确定性时间内完成全部运算。传统方案要么算力全给视觉、控制就来不及,要么保证控制延迟、视觉帧率就上不去。而数据流架构下,不同模型和算法可以映射到同一张数据流图的不同路径,数据就绪就独立运行,不需要操作系统调度,也不需要上下文切换,延迟和利用率都从架构层面得到保障。
2、128GB大显存:端侧大模型的“脑容量”
高光D35最受关注的配置之一,是单芯片128GB的大显存。在端侧芯片普遍只有几GB到几十GB显存的当下,这个配置显得格外“奢侈”。
在范东睿看来,这不是参数堆砌,而是物理AI的刚需:“就像人一样,脑容量大才能考虑更多边界条件,做出更合理的决策。机器人不是只会做预设动作,要应对开放环境的动态变化,就要有足够的模型容量和知识储备。”随着端侧大模型的普及,128GB显存的价值正在快速释放。本地数字人、医生专属知识库、工业视觉大模型...这些场景都要求模型不回传云端,在端侧本地运行。大显存加上数据流架构的高数据搬运效率,让端侧跑大模型从能用变成好用。
3、确定性延迟:物理世界的安全底线
物理世界的计算和云端最大的不同,是延迟的确定性。云端推理慢几十毫秒用户感知不到,但机器人运动控制、自动驾驶决策、通信基带处理,差几十毫秒就可能出事故。
传统GPU的延迟是波动的:缓存命中、调度队列、Warp冲突都会带来抖动,标称延迟都是最优工况,实际运行中波动很大。而数据流架构的延迟是编译期就确定的——数据路径固定、触发条件明确,端到端延迟可预测、可控制,最坏情况执行时间(WCET)有严格保障。
这也正是D35能切入通信卫星地面接收、工业控制等强实时场景的核心原因。在这些领域,“不超时”比快更重要。
4、四大场景落地验证
据悉,高光D35目前已经在四大核心场景完成规模化验证:
· 视频智能计算是第一大场景:占订单总量50%以上。现实世界中,摄像头产生的视频数据量巨大,硬盘价格翻了几番,存储周期要求从15天延长到3个月,成本压力极大。睿芯的解决方案是用AI做芯片级无损压缩,已在公安部拿到认证,压缩比可达10到20倍,硬盘用量减少90%,大幅降低安防、城市大脑的存储成本。
· 具身智能是增长最快的方向:约占当前订单量20%。睿芯已与启元机器人等头部企业开展合作,D35芯片在机器人场景的适配和连接效果目前测试得非常好。此外,在无人配送、安防巡逻等场景测试验证效果优异,20ms内完成路线自主纠偏,进入供货准备阶段。
· 通信与卫星接收是刚需场景:约占15%。匹配低轨卫星地面接收的确定性延迟需求,在通信基站加速场景落地。
· 本地AI与AIPC正在爆发:隐私需求推动本地AI计算。以公共场所的数字人为例,公安部门要求必须本地推理,因为游客可能有诱导性提问,本地模型可以做意图识别和内容风控,确保输出合规。
“对比国际主流边缘AI芯片,D35的功能全覆盖,接口更丰富,通信、视频处理等专项场景性能是对方的数倍,成本还更低。”范东睿透露,公司去年已经实现盈亏平衡,这在国产高端AI芯片创业公司中极为罕见,也印证了数据流路线的商业可行性。
生态破局:开放路线的生存哲学
数据流芯片最大的行业质疑,就是软件生态和编程门槛。“数据流硬件效率高,但编译器难写、开发者难用”是行业的普遍认知。
睿芯的解法很明确:不把编程负担转嫁给用户,用户用起来有负担的地方,睿芯自己来解决。
范东睿表示,公司自研了名为“丹尼斯”的自动化编译工具,名字源自高光荣教授的导师Jack Dennis,可以自动把AI模型翻译优化到D35芯片上,大幅降低底层开发工作量。在框架层面,D35和PyTorch、TensorFlow等主流AI框架完全兼容,上层应用可以直接迁移。
在生态建设上,范东睿坚持分工协作的思路:“我们本质是芯片公司,一切努力都是为了让芯片被用起来。构建生态正是表明自己不要做所有事,只要生态伙伴能承担的事情,睿芯马上就会撤出来,我们就专注把芯片做好,大家一起共赢。”为此,睿芯发起了“光荣社区”来运营开发者生态,目前已经有几十家生态合作伙伴,覆盖算法、方案、整机各个环节。
更具标志性的认可是英特尔的选择:英特尔最终选择了睿芯的自研RISC-V CPU内核IP进行全球采购,这既是对睿芯技术实力的背书,也证明了开放架构路线的国际竞争力——好的技术,不管在哪里,都会被市场认可。
定义物理AI时代的算力底座
对于数据流架构的未来,范东睿的判断很务实:它不会取代GPU,而是会开辟一条全新的赛道。在他看来,GPU在云端训练、通用计算场景依然不可替代,但在物理AI、边缘推理这些垂直场景,数据流架构会凭借能效和延迟优势,成为最优解。
关于未来的技术路线,睿芯的规划清晰地分为两个方向:
· 更高性能:持续提升算力、带宽、存储容量,降低延迟,支撑更复杂的场景和更大的模型,让端侧智能的上限不断提高;
· 更低功耗:推出更低功耗、更小体积的产品,适配微型、移动、电池供电的边缘场景,拓宽数据流架构的适用边界。
“芯片行业的规律是,五年前的设计决定了今天的产品。所以现在就要思考五年后市场需要什么样的芯片。”范东睿强调。
从更大的行业视角看,数据流架构的崛起,本质上是AI算力竞争的重心转移:从比拼峰值算力,转向比拼架构效率;从比拼云端规模,转向比拼端侧落地能力;从跟随别人的标准,转向走出自己的路线。
过去几十年,中国芯片产业更多是在别人的规则里追赶。而数据流与RISC-V的结合,给了行业一个换道的机会——不用在别人划定的赛道里死磕,而是在物理AI这个新赛场,用开放的架构、自主的技术,定义新的标准。
就像范东睿一直坚信的:做芯片,最终靠产品说话。当数据流架构从论文变成量产芯片,从实验室走向千行百业,这条冷了六十年的技术路线,正在迎来属于它的时代。而物理AI的真正竞赛,也才刚刚开始。
责任编辑:chenguang
相关文章
-
- 半导体行业观察
-
- 摩尔芯闻