速显微电子发布全新雷神计算架构及天衡GPGPU
发布会由速显微电子COO巴宇澄女士主持。公司联合创始人兼总经理王攀博士讲述了速显微自创立以来始终坚持自研GPU全栈技术为核心的企业战略,并透露公司正在数字存算一体以及将大模型写死在芯片上的“模型即芯片”等先进技术领域进行攻关。

新品发布环节由速显微创始人,董事长兼CTO项天博士主持。
公司战略合作伙伴代表,投资人及多家生态链上市公司董事长,高管等出席活动并见证发布。
雷神计算架构:破解算力适配之困,塑造高性能芯片价值商业闭环
TUCA架构是速显微电子自主研发、面向下一代AI与异构计算场景的软硬件协同计算架构,可结合速显微电子自研GPGPU、AI加速芯片及异构计算硬件,覆盖从应用开发、算子编译、运行时调度到硬件执行的关键计算链路,构建统一、高效、可扩展的异构计算软件底座,帮助开发者和行业客户更高效地使用异构算力,推动芯片能力向应用价值转化。
统一异构算力底座
TUCA为GPGPU、AI加速器、CPU等异构计算提供统一软件抽象层与运行支撑,通过统一开发范式降低适配复杂度,方便调用底层算力。系统层面协同设计软硬件,优化调度、内存、同步及多设备协同效率。
统一编程接口
TUCA提供统一编程接口,支持GPGPU和AI开发,封装底层硬件差异,降低向速显微平台迁移的成本。面向AI推理、并行计算、矩阵、图像等任务,其接口和运行时简化开发部署,提升效率,降低适配门槛。
生态兼容与迁移适配
TUCA面向主流AI框架、模型部署工具链和行业应用环境进行适配设计,支持模型迁移、算子适配、应用集成和行业生态建设,能够帮助客户降低从既有生态迁移到速显微计算平台的难度,使芯片产品不仅具备硬件算力优势,也具备面向应用落地的软件生态支撑能力。
高性能加速库支持
TUCA内置面向AI与通用计算的加速库,并针对自研芯片深度优化,支撑AI推理、图像处理、机器人视觉、工业计算等应用,开发者可直接调用,加速部署。编译层深度融合硬件,支持算子融合、访存与布局优化,协同编译器和运行时,提升资源利用效率,减少数据移动与等待,保障复杂任务稳定执行。
开源共建与生态扩展
TUCA核心组件规划采用MIT License等宽松开源协议,支持二次开发、修改、商用分发和生态共建。开源共建不仅有助于提升平台透明度和开发者信任,也有利于加速算法、工具链、行业应用和解决方案的落地,形成围绕速显微芯片产品的长期生态价值。
全场景灵活部署
TUCA面向机器人、自动驾驶、工业视觉、医疗、科学计算、图形、数据及大模型等场景,依托统一软件栈与异构算力提升效率、加速落地,并实现平滑生态迁移,推动芯片向系统级方案转化。作为速显微面向具身智能与边缘AI的关键布局,TUCA连接硬件与应用,是构建产品、生态与商业闭环的桥梁。
天衡1100GPGPU:异构SoC协同,精准匹配边缘AI计算场景
“天衡1100”是公司自主研发的首颗面向边缘AI推理场景的GPGPU SoC芯片。芯片集成高性能GPU计算簇、通用CPU簇、多媒体处理子系统和丰富的系统接口,依托全面国产生态,面向边缘AI推理场景构建国产可控方案,满足行业客户长期供货稳定性需求。
异构SoC协同设计,多模块互联高效协同
“天衡1100”采用一体化异构SoC架构,通过CPU和GPU协同设计及软硬件联合调度,实现计算任务合理分配,提升能效与吞吐能力,增强多场景泛化能力。芯片集成了CPU、GPGPU、ISP、视频编解码单元及高速外设接口,经高速互联总线形成统一片上系统,显著降低数据交互延迟,提高传输效率,使图像输入、视频处理、AI推理、输出与控制反馈形成高效闭环,满足边缘智能设备对实时性与稳定性的需求。
大容量内存满足多任务处理需求
“天衡1100”支持最高128GB板载高速内存配置,内存带宽85.3GB/s,为边缘AI推理、多路视频处理、大模型推理和复杂数据处理任务提供充足的数据吞吐支撑。应对机器人、工业视觉和自动驾驶等场景时,TH1100可以支持更大的模型、更复杂的中间特征缓存和更多路传感器数据处理,在处理多任务并发的需求上游刃有余。
AI算力矩阵配置灵活度高
“天衡1100”支持FP32、FP16、FP8、INT8、INT4、FP4等多种精度计算,能够根据不同AI模型和应用场景,在计算精度、性能和能效之间进行灵活匹配。这种混合精度算力配置能够覆盖从高精度计算到低功耗推理的多类需求,在AI推理常用的FP4混合精度计算方面,TH1100可提供50TOPS算力;在支持稀疏计算的场景下,FP4稀疏算力可达100TOPS。
多媒体能力优异,轻松应对高清视频需求
“天衡1100”集成高性能多媒体子系统,可向多路摄像头输入、高清视频处理、图像增强、视频分析和AI感知任务提供支撑。
通过双路ISP、多媒体处理单元和丰富外设接口,“天衡1100”可以为机器人、工业检测、自动驾驶和智慧医疗等应用提供更强的环境感知和数据处理能力。
AI任务引擎高效,强劲处理数据流处理
“天衡1100”内置24个Tensor Core(TC),可高效执行矩阵运算,面向AI推理中的矩阵乘法、卷积、Trans-former关键算子和张量计算任务提供硬件加速能力。
同时,Tensor Memory Accelerator(TMA)支持多维张量数据搬运,可减少数据搬运与计算执行之间的等待开销。TC与TMA的协同工作,有助于提升AI算子的执行效率,使系统在处理复杂模型和高吞吐推理任务时具备更好的性能表现。
外设接口丰富,智能生态互联场景广阔
“天衡1100”对边缘计算的良好支持、双路ISP设计以及丰富的外设接口匹配等特性,可连接摄像头、显示设备、存储设备、网络模块、工业控制接口和多类传感器,用于视觉感知、AI推理、路径规划、任务决策和控制反馈,缺陷检测、质量分析和实时图像处理。在智慧医疗场景中,可用于医学影像处理、牙科影像分析和AI辅助诊断等应用。
师出同门,攻坚“中国芯”:中国科大团队打造端侧智能计算核心企业
速显微电子创建于2015年,是国内最早成立的GPU设计公司之一,专注于嵌入式GPU芯片及相关系统解决方案的研发,并创新地将数字存算设计与GPU IP结合,同时开展大模型参数硬化在GPU芯片的技术研发。
公司在相关领域拥有超过十年的深厚技术积累,具备芯片架构设计与核心IP开发,硬件算子,SoC与操作系统研发,应用模型与系统验证,工具链构建以及系统集成与生态建设的全链条技术研发和工具配套能力,是国内极少数实现全链条自主设计的IC企业,在天津、苏州、合肥,深圳等地设立有研发中心。
公司创始人兼董事长项天博士,联合创始人兼总经理王攀博士创业十年来,联合一批同样出自中国科大博士、硕士背景的核心团队和产业资深人士,秉承相同的价值观和工作理念,将公司打造成为行业赛道中不可忽视的力量。
近年来,公司相关产品聚焦云端或车规级高端市场,面向消费级物联网的低功耗、低成本解决方案。速显微研发的GC系列是全球第一款集成GPU的MCU芯片。2019年量产的GC9003是国内第一款能跑3D图形的车规MCU。目前,GC90系列芯片已形成完整产品矩阵:GC9003芯片通过AEC-Q100车规级认证并累计出货超百万颗;GC9002芯片获评“玄铁优选芯片”;GC9005芯片可同时处理1080P渲染和语音人脸识别。
通过多年发展,速显微电子相关产品已广泛应用于汽车智能座舱、工业控制、国防军工等领域。
2025年,速显微电子作为起草单位参与了工信部主导的《半导体集成电路图形处理器(GPU)》国家标准制订工作。公司创始人兼董事长项天博士作为标准核心起草人参与相关工作。
2026年,公司在“天衡”GPGPU 为代表的IP内核产品上实现了图形处理与AI增强计算的深度融合。
贯通生态,共赢数智未来
发布会上,速显微电子与深度机智(北京)科技有限公司(深度机智)、国仪量子技术(合肥)股份有限公司(国仪量子)分别签署战略合作协议签约,向外界进一步展示了公司日益蓬勃和颇具竞争力的战略生态圈。
深度机智是由北京中关村学院与中关村人工智能研究院联合孵化的物理AI企业,专注物理人工智能技术研发。双方在未来的战略合作中,将依托速显微电子的国产GPU算力基础,展开针对物理AI产业生态构建、技术落地、场景赋能、产业升级等方面的深度合作,共同推动物理AI技术从底层创新走向规模化产业应用。
国仪量子是国内少数具备电子束精密仪器自主研发生产能力的高端仪器企业,在电子光学系统、纳米级精密加工与检测等底层技术方向上拥有深厚技术储备。根据协议约定,双方将规划依托速显微电子在AI ROM(人工智能只读存储器)模型固化芯片领域的技术积累与产业资源,以及国仪量子在电子束精密仪器领域的研发制造能力,围绕AI ROM相关业务开展合作。
速显微电子在发布会上同时官宣总部迁址天津市津南区,并进行了新总部揭牌仪式。