此前,我们盘点了壁仞、燧原、沐曦等国产GPU“四小龙”,它们凭借极致算力在高端算力赛道强势突围。
本篇我们继续深耕国产GPU赛道,聚焦四家细分赛道标杆企业:主打训推一体的天数智芯、深耕军工专用领域的景嘉微、双线布局消费级与智算市场的摩尔线程、依托百度生态的昆仑芯。
如果用关键词概括头部厂商特色:华为昇腾是系统级全能巨头、海光是借船出海稳健发展、壁仞科技主打极致算力碾压。
而这四家企业的核心竞争力可总结为细分突围:不盲目对标英伟达全栈能力,拒绝全域竞争,而是深耕垂直赛道,凭借专属技术与场景优势,构筑起自身的不可替代性,成为国产GPU产业的重要中坚力量。
一、天数智芯:拿下国产全自研GPU训推一体标杆
1.1 从0到1的突破,补齐国产云端训练GPU短板
天数智芯(Iluvatar CoreX)2018年成立于上海,是国内为数不多聚焦通用GPGPU研发的企业,核心战略锚定训推一体化完整算力方案。
2021年3月,公司推出天垓100云端训练芯片,这是国内首款基于纯自研GPU架构的云端训练产品,彻底打破国产高端通用训练GPU的空白,实现了行业从0到1的关键性突破。
2022年12月,天数智芯再推推理端核心产品智铠100,至此形成训练+推理+边缘计算的完整布局,成为国内唯一具备云边协同、训推组合全场景通用算力解决方案的企业。
1.2 智铠100参数详解
| 参数 | 智铠100(MR-V100) | 定位 |
|---|---|---|
| 制程 | 7nm | 第二代通用GPU架构 |
| FP32 | 24 TFLOPS | 通用计算 |
| FP16 | 96 TFLOPS | AI训练 |
| INT8 | 384 TOPS | AI推理 |
| 显存带宽 | 800 GB/s | 理论峰值 |
| 视频解码 | 128路并发 | 多规格解码 |
| 指令集 | 800+通用指令 | 自研ISA |
算力层面,智铠100 INT8推理算力达384 TOPS,实测性能较市面主流同类产品提升2-3倍,推理场景优势显著。更核心的优势在于低迁移成本,产品延续天垓系列高适配特性,通过标准化接口大幅降低业务迁移门槛,助力企业实现业务系统无感知切换、快速落地。
1.3 训推一体与全场景落地
天数智芯的产品线布局如下:
| 系列 | 定位 | 代表产品 |
|---|---|---|
| 天垓系列 | 云端训练 | 天垓100 → 天垓150 |
| 智铠系列 | 云端推理 | 智铠100(MR-V100) |
| 彤央系列 | 边缘端 | TY1000/TY1100/TY1200 |
其主打的训推一体模式是核心差异化亮点,同一套硬件设备可兼顾模型增量训练与日常推理任务,无需企业分别采购训练、推理两套设备,大幅降低算力采购与运维成本。
目前天数智芯产品已实现多行业深度落地:
AI算力集群:联合无问芯穹搭建Infini-AI异构云平台,集群算力利用率高达97.6%;
新零售场景:携手阶跃星辰、瑞幸咖啡,打造消费领域垂类大模型应用;
金融风控:为太平金科提供OCR识别、人脸识别及DeepSeek R1模型本地化部署服务;
医疗领域:赋能衢州医院,支撑DeepSeek一体机70B大模型本地稳定运行;
城市交通:天垓系列芯片落地长沙地铁,驱动城轨专属大模型一体机。


二、景嘉微:军工GPU的坚守者
2.1 从战斗机座舱起步
不同于一众聚焦AI算力、数据中心赛道的GPU企业,景嘉微从诞生之初就锚定军工高可靠图形显控赛道,核心追求并非极致算力,而是极端环境下的稳定运行能力。
2014年,景嘉微推出国内首款自主可控GPU芯片JM5400,采用28nm制程,专为军用场景定制,广泛应用于战斗机座舱仪表盘、雷达显控台、舰载指挥终端、装甲车载设备等核心军工场景。
军工GPU与民用数据中心GPU的考核标准差异悬殊,核心对比如下:


这个起点决定了景嘉微的基因:不求算力最高,但求可靠性最强。军用GPU的核心要求与民用完全不同
| 维度 | 军用GPU(景嘉微) | 民用/数据中心GPU |
|---|---|---|
| 核心指标 | 可靠性/宽温/抗震动 | 算力/带宽/能效比 |
| 工作温度 | -55°C ~ +85°C | 0°C ~ +50°C(数据中心空调房) |
| 供货周期 | 10年以上(军工项目周期长) | 2-3年一代(快速迭代) |
| 抗电磁干扰 | 必须通过军规认证 | 无特殊要求 |
| 抗震动 | 适应野外/机载/舰载环境 | 机房固定部署 |
2.2 JM9系列:从军工到民用的尝试
为突破军工场景局限、开拓民用市场,景嘉微持续迭代产品,完成了从纯军工到“军工+民用办公”的跨界尝试,三代核心产品参数与定位如下:
| 参数 | JM5400 | JM7200 | JM9271 |
|---|---|---|---|
| 发布年份 | 2014 | 2018 | 2022 |
| 制程 | 28nm | 28nm | 28nm |
| FP32 | — | — | ~1 TFLOPS |
| 显存 | — | — | 8GB GDDR5 |
| 接口 | — | — | PCIe 3.0 x16 |
| 功耗 | — | — | <75W |
| 3D API | OpenGL ES | OpenGL 3.3 | OpenGL 4.3 |
| 温度范围 | 军规宽温 | 军规宽温 | -55°C ~ +85°C |
| 性能对标 | 嵌入式图形 | 桌面办公 | GTX 1050 |
JM9系列有一个让人唏嘘的故事。景嘉微最初的设计目标是对标NVIDIA GTX 1080——这在2021年算是一款中高端游戏卡。但实际流片后,JM9231只达到了GTX 1050的水平,性能差距巨大。更遗憾的是,JM9系列原计划采用14nm制程,但最终流片仍停留在28nm。
为什么会"缩水"?核心原因有三:
第一,GPU架构设计本身复杂度极高。从28nm嵌入式图形GPU,升级到14nm高性能3D渲染GPU,并不是简单的制程迭代,而是涉及整个架构设计方法论、图形流水线、并行计算能力的全面升级。
第二,先进制程流片成本压力巨大。14nm一次流片费用通常超过3000万美元,而28nm成本相对更低。对于长期依赖军工订单、商业化收入节奏相对稳健的景嘉微来说,选择28nm更像是成本、风险与交付节奏之间的平衡。
第三,高性能GPU架构积累需要时间。英伟达、AMD在高性能GPU领域已有长期技术沉淀,而国产GPU厂商要从嵌入式图形、军工显控逐步走向高性能通用计算,必然要面对架构、IP、软件生态等多重挑战。
2.3 景嘉微的AI困境
需要特别指出的是:景嘉微JM9系列目前不适合AI计算。
| AI能力 | 景嘉微JM9271 | AI GPU(参考) |
|---|---|---|
| INT8/FP16计算单元 | 无 | Tensor Core / 矩阵单元 |
| CUDA兼容 | 不支持 | 原生支持 |
| OpenCL | 未提供 | 支持 |
| PyTorch/TensorFlow | 无法直接调用 | 原生支持 |
| 通用计算 | 仅OpenGL Compute Shader | 完整GPGPU |
景嘉微的价值不在于AI算力,而在于军工可靠性——在-55°C的高原哨所、在电磁干扰密集的舰载指挥舱、在震动剧烈的装甲车终端,景嘉微的GPU能稳定运行十年以上。这种能力是所有AI GPU厂商都不具备的。
在-55℃的高原哨所、电磁干扰密集的舰载指挥舱、震动剧烈的装甲车终端,普通民用GPU可能难以长期稳定运行,但景嘉微的产品却能在这类场景中持续服役十年以上。这种能力不是纸面算力能衡量的,也不是所有AI GPU厂商都能替代的。
从转型方向看,景嘉微正在从“军工图形GPU”逐步拓展到“军工+民用桌面GPU”。目前,JM7200已经进入桌面办公市场,可适配飞腾、龙芯等国产CPU,以及统信UOS、麒麟等国产操作系统。未来,若制程升级和AI能力补强顺利,JM9272+系列有望进一步打开成长空间。
三、摩尔线程:消费级+智算中心双线作战
3.1 "国产GPU第一股"
摩尔线程成立于2020年,创始人袁 Jian 曾担任英伟达全球副总裁、中国区总经理,团队在GPU设计、生态建设和市场推广方面拥有较深积累。
2024年12月5日,摩尔线程正式登陆科创板,成为“国产GPU第一股”,募资规模接近80亿元,上市初期市值一度突破4000亿元。这也意味着,国产GPU企业开始从技术研发阶段走向更成熟的商业化和资本化阶段。
摩尔线程的核心特色是自研MUSA统一系统架构。与很多国产GPU厂商侧重单一算力场景不同,MUSA架构同时覆盖图形渲染、AI计算和视频编解码三大能力,是国产GPU中少数具备“全功能”属性的技术路线。
3.2 MTT S4000:智算中心加速卡
| 参数 | MTT S4000 | NVIDIA A100 |
|---|---|---|
| 架构 | 第三代MUSA(曲院) | Ampere |
| FP32 | 25 TFLOPS | 19.5 TFLOPS |
| FP16 | 100 TFLOPS | 312 TFLOPS |
| 显存 | 48GB | 80GB HBM2e |
| 显存带宽 | 768 GB/s | 2.0 TB/s |
| 互联 | MTLink 240 GB/s | NVLink 600 GB/s |
| CUDA兼容 | 是 | 原生CUDA |
从参数看,MTT S4000的FP32算力为25 TFLOPS,高于A100的19.5 TFLOPS;但FP16算力为100 TFLOPS,与A100的312 TFLOPS仍有明显差距。这说明摩尔线程在通用计算方面具备较强基础,但在张量计算和AI训练效率上仍有提升空间。
此外,MTT S4000配备48GB显存和768 GB/s显存带宽,相比A100 80GB版本也存在差距。不过,摩尔线程的优势并不只在单卡参数,还在于生态兼容和全栈方案。
目前,MTT S4000支持CUDA生态兼容,能够降低用户从英伟达平台迁移的门槛。同时,摩尔线程还推出了KUAE智算中心解决方案,覆盖硬件、软件、集群管理等环节,类似英伟达DGX的全栈思路,目标是为智算中心客户提供一体化算力支撑。
3.3 MTT S80:消费级显卡
除了智算中心产品线,摩尔线程还推出了消费级显卡MTT S80——这是国产GPU中少有的面向消费市场的产品。MTT S80的性能约为NVIDIA RTX 4090的30%,支持图形渲染和轻度AI推理。虽然性能与主流游戏卡有较大差距,但它证明了国产GPU可以进入消费市场。
四、昆仑芯:百度系的XPU架构
4.1 百度AI生态的硬件底座
昆仑芯脱胎于百度AI芯片部门,2021年独立运营。作为百度系芯片企业,昆仑芯的最大优势不是单点硬件参数,而是与百度AI生态的深度绑定。
尤其是在深度学习框架方面,昆仑芯与飞桨(PaddlePaddle)实现了深度集成。飞桨是国内市场份额较高的AI框架之一,拥有大量企业用户、开发者和行业落地案例。这种软硬协同能力,使昆仑芯在AI推理、大模型落地和百度内部业务场景中具备天然优势。
技术路线上,昆仑芯采用自研XPU-R架构。与华为达芬奇、壁仞壁立仞、燧原邃思等路线不同,XPU架构更强调“AI专用+通用计算兼顾”,但整体更偏向推理场景。也就是说,昆仑芯并不是单纯追求最高单卡算力,而是围绕实际业务推理需求做优化。
4.2 R200参数
| 参数 | 昆仑芯 R200 |
|---|---|
| 架构 | XPU-R(自研) |
| 制程 | 7nm |
| INT8 | 256 TOPS |
| FP16 | 128 TFLOPS |
| FP32 | 32 TFLOPS |
| 显存 | 16/32GB GDDR6 |
| 显存带宽 | 512 GB/s |
| 接口 | PCIe 4.0 x16 |
| 定位 | 数据中心推理 |
可以看出,R200的定位非常明确:服务AI推理任务。INT8算力256 TOPS、FP16算力128 TFLOPS,能够较好支撑自然语言处理、计算机视觉、语音识别等推理场景。
与高端训练芯片不同,R200采用GDDR6显存而非HBM2e,显存带宽为512 GB/s。这说明昆仑芯的策略并不是盲目堆高带宽和成本,而是在推理场景中寻找性价比与落地效率的平衡。
在集群方案方面,昆仑芯推出R480-X8加速器,通过集成8张R200,可提供2048 TOPS的INT8推理算力。这类方案更适合需要大规模推理部署的场景,比如搜索推荐、内容理解、语音交互、AI客服和大模型应用落地。
在百度内部,昆仑芯已经成为搜索引擎、文心一言等AI产品的重要推理加速底座。这也说明,昆仑芯的价值不只在于芯片本身,而在于与百度业务场景的长期验证和协同优化。


五、四家厂商对比与国产GPU全景总结
5.1 定位差异
| 维度 | 天数智芯 | 景嘉微 | 摩尔线程 | 昆仑芯 |
|---|---|---|---|---|
| 定位 | GPGPU训推一体 | 军工图形GPU | 全功能GPU | AI推理专用 |
| 主力产品 | 智铠100/天垓100 | JM9271 | MTT S4000 | R200 |
| FP32 | 24T | ~1T | 25T | 32T |
| INT8 | 384T | 无 | 未公开 | 256T |
| 制程 | 7nm | 28nm | 7nm | 7nm |
| CUDA兼容 | 框架兼容 | 不支持 | 是 | 飞桨原生 |
| 上市状态 | 已上市 | 创业板已上市 | 科创板已上市 | 未上市 |
| 核心场景 | 云端训练+推理 | 军工/桌面办公 | 智算中心+消费级 | 百度生态推理![]() |
5.2 国产GPU全景总结
经过第7-10篇的深入分析,我们可以对国产GPU主要厂商做一个六维能力总结:
| 厂商 | 单卡算力 | 软件生态 | 互联能力 | 制程 | 量产 | 核心优势 |
|---|---|---|---|---|---|---|
| 华为昇腾 | ★★★★ | ★★★★★ | ★★★★ | ★★★ | ★★★★★ | 全栈自研+系统级 |
| 海光DCU | ★★★ | ★★★★★ | ★★ | ★★ | ★★★★ | 兼容ROCm+FP64 |
| 壁仞 | ★★★★★ | ★★ | ★★★ | ★★★ | ★★ | 单卡算力最强 |
| 沐曦 | ★★★ | ★★★★ | ★★ | ★★★ | ★★★ | CUDA兼容最佳 |
| 摩尔线程 | ★★★ | ★★★ | ★★ | ★★★ | ★★★ | 全功能+消费级 |
| 天数智芯 | ★★ | ★★★ | ★★ | ★★★ | ★★★ | 训推一体 |
5.3 三条启示
通过对这四家企业的分析,可以得到三条比较明确的启示。
第一,没有全能选手,只有细分王者。
目前,没有任何一家国产GPU企业能够在算力、制程、软件生态、互联能力、消费级市场、数据中心市场等所有维度上全面领先。
华为系统级能力最强,但制程受限;壁仞单卡算力突出,但生态仍需建设;沐曦CUDA兼容能力较强,但互联和量产节奏仍需观察;景嘉微军工可靠性强,但AI能力较弱;摩尔线程和天数智芯也都有自己的优势边界。
这说明,国产GPU产业不是靠某一家公司就能完成全部替代,而是需要不同厂商在不同场景中各自突破。
第二,软件生态才是长期护城河。
GPU竞争从来不是只比硬件参数。真正决定用户迁移意愿的,是软件生态是否成熟、开发成本是否足够低、现有模型是否能快速跑起来。
华为CANN和MindSpore代表了全栈自研路线,自主性强,但学习门槛较高;沐曦MXMACA强调CUDA兼容,能降低用户迁移成本;摩尔线程则通过CUDA兼容和KUAE方案推进智算中心落地。
未来,谁能率先形成“开发者愿意迁移、模型能够适配、性能持续优化”的闭环,谁才有可能在国产GPU竞争中真正活下来。
第三,量产交付比纸面参数更重要。
国产GPU行业有一个常见现象:发布会参数亮眼,但真正走向客户环境后,还需要经历漫长的打磨期。
例如,壁仞BR100在2022年发布,但直到2025年才逐步实现量产;景嘉微JM9系列最初目标较高,最终受限于制程、成本和架构积累,实际性能出现缩水。
这说明,从“发布一款芯片”到“客户真正能用”,通常需要2到3年时间。期间可能遇到制程降级、良率不足、性能优化不及预期、软件适配缓慢等问题。
因此,评价一家国产GPU企业,不能只看发布会参数,更要看它是否能稳定交付、持续迭代,并在真实业务场景中跑通。
结语
国产GPU的发展,正在从“单点突破”走向“体系化突围”。
天数智芯的训推一体、景嘉微的军工可靠性、摩尔线程的消费级与智算双线布局、昆仑芯的百度生态推理路线,代表了国产GPU产业中几种不同的生存策略。
它们不一定都追求全面替代英伟达,也不一定都要做最强算力,但都在各自的优势领域建立了不可替代性。
从下一篇开始,我们将从技术维度继续拆解国产GPU面临的共性挑战,包括制造瓶颈、软件生态短板和AI框架适配问题。
本文数据来源:天数智芯官网/BAIA智源社区/界面新闻/腾讯云;景嘉微百度百科/CSDN技术博客/EET-China;摩尔线程官网/知乎/百度文库;昆仑芯百度百科/知乎/CSDN。数据截至2025年12月。
安徽云联万佳信息科技有限公司

