新兴厂商下篇:天数智芯、景嘉微、摩尔线程、昆仑芯

新兴厂商下篇:天数智芯、景嘉微、摩尔线程、昆仑芯

行业动态 2026-08-26 编辑部 7
新兴厂商下篇:天数智芯、景嘉微、摩尔线程、昆仑芯

此前,我们盘点了壁仞、燧原、沐曦等国产GPU“四小龙”,它们凭借极致算力在高端算力赛道强势突围。

本篇我们继续深耕国产GPU赛道,聚焦四家细分赛道标杆企业:主打训推一体的天数智芯、深耕军工专用领域的景嘉微、双线布局消费级与智算市场的摩尔线程、依托百度生态的昆仑芯。

如果用关键词概括头部厂商特色:华为昇腾是系统级全能巨头、海光是借船出海稳健发展、壁仞科技主打极致算力碾压

而这四家企业的核心竞争力可总结为细分突围:不盲目对标英伟达全栈能力,拒绝全域竞争,而是深耕垂直赛道,凭借专属技术与场景优势,构筑起自身的不可替代性,成为国产GPU产业的重要中坚力量。


一、天数智芯:拿下国产全自研GPU训推一体标杆

1.1 从0到1的突破,补齐国产云端训练GPU短板

天数智芯(Iluvatar CoreX)2018年成立于上海,是国内为数不多聚焦通用GPGPU研发的企业,核心战略锚定训推一体化完整算力方案。

2021年3月,公司推出天垓100云端训练芯片,这是国内首款基于纯自研GPU架构的云端训练产品,彻底打破国产高端通用训练GPU的空白,实现了行业从0到1的关键性突破。

2022年12月,天数智芯再推推理端核心产品智铠100,至此形成训练+推理+边缘计算的完整布局,成为国内唯一具备云边协同、训推组合全场景通用算力解决方案的企业。


1.2 智铠100参数详解

参数智铠100(MR-V100)定位
制程7nm第二代通用GPU架构
FP3224 TFLOPS通用计算
FP1696 TFLOPSAI训练
INT8384 TOPSAI推理
显存带宽800 GB/s理论峰值
视频解码128路并发多规格解码
指令集800+通用指令自研ISA

算力层面,智铠100 INT8推理算力达384 TOPS,实测性能较市面主流同类产品提升2-3倍,推理场景优势显著。更核心的优势在于低迁移成本,产品延续天垓系列高适配特性,通过标准化接口大幅降低业务迁移门槛,助力企业实现业务系统无感知切换、快速落地。


1.3 训推一体与全场景落地

天数智芯的产品线布局如下:

系列定位代表产品
天垓系列云端训练天垓100 → 天垓150
智铠系列云端推理智铠100(MR-V100)
彤央系列边缘端TY1000/TY1100/TY1200

其主打的训推一体模式是核心差异化亮点,同一套硬件设备可兼顾模型增量训练与日常推理任务,无需企业分别采购训练、推理两套设备,大幅降低算力采购与运维成本。

目前天数智芯产品已实现多行业深度落地:

AI算力集群:联合无问芯穹搭建Infini-AI异构云平台,集群算力利用率高达97.6%;

新零售场景:携手阶跃星辰、瑞幸咖啡,打造消费领域垂类大模型应用;

金融风控:为太平金科提供OCR识别、人脸识别及DeepSeek R1模型本地化部署服务;

医疗领域:赋能衢州医院,支撑DeepSeek一体机70B大模型本地稳定运行;

城市交通:天垓系列芯片落地长沙地铁,驱动城轨专属大模型一体机。

微信图片_2026-08-26_105508_450.png

二、景嘉微:军工GPU的坚守者

2.1 从战斗机座舱起步

不同于一众聚焦AI算力、数据中心赛道的GPU企业,景嘉微从诞生之初就锚定军工高可靠图形显控赛道,核心追求并非极致算力,而是极端环境下的稳定运行能力。

2014年,景嘉微推出国内首款自主可控GPU芯片JM5400,采用28nm制程,专为军用场景定制,广泛应用于战斗机座舱仪表盘、雷达显控台、舰载指挥终端、装甲车载设备等核心军工场景。

军工GPU与民用数据中心GPU的考核标准差异悬殊,核心对比如下:

微信图片_2026-08-26_105458_116.png

   这个起点决定了景嘉微的基因:不求算力最高,但求可靠性最强。军用GPU的核心要求与民用完全不同

维度军用GPU(景嘉微)民用/数据中心GPU
核心指标可靠性/宽温/抗震动算力/带宽/能效比
工作温度-55°C ~ +85°C0°C ~ +50°C(数据中心空调房)
供货周期10年以上(军工项目周期长)2-3年一代(快速迭代)
抗电磁干扰必须通过军规认证无特殊要求
抗震动适应野外/机载/舰载环境机房固定部署


2.2 JM9系列:从军工到民用的尝试

为突破军工场景局限、开拓民用市场,景嘉微持续迭代产品,完成了从纯军工到“军工+民用办公”的跨界尝试,三代核心产品参数与定位如下:

参数JM5400JM7200JM9271
发布年份201420182022
制程28nm28nm28nm
FP32~1 TFLOPS
显存8GB GDDR5
接口PCIe 3.0 x16
功耗<75W
3D APIOpenGL ESOpenGL 3.3OpenGL 4.3
温度范围军规宽温军规宽温-55°C ~ +85°C
性能对标嵌入式图形桌面办公GTX 1050

   JM9系列有一个让人唏嘘的故事。景嘉微最初的设计目标是对标NVIDIA GTX 1080——这在2021年算是一款中高端游戏卡。但实际流片后,JM9231只达到了GTX 1050的水平,性能差距巨大。更遗憾的是,JM9系列原计划采用14nm制程,但最终流片仍停留在28nm。


为什么会"缩水"?核心原因有三:


第一,GPU架构设计本身复杂度极高。从28nm嵌入式图形GPU,升级到14nm高性能3D渲染GPU,并不是简单的制程迭代,而是涉及整个架构设计方法论、图形流水线、并行计算能力的全面升级。


第二,先进制程流片成本压力巨大。14nm一次流片费用通常超过3000万美元,而28nm成本相对更低。对于长期依赖军工订单、商业化收入节奏相对稳健的景嘉微来说,选择28nm更像是成本、风险与交付节奏之间的平衡。


第三,高性能GPU架构积累需要时间。英伟达、AMD在高性能GPU领域已有长期技术沉淀,而国产GPU厂商要从嵌入式图形、军工显控逐步走向高性能通用计算,必然要面对架构、IP、软件生态等多重挑战。


2.3 景嘉微的AI困境

需要特别指出的是:景嘉微JM9系列目前不适合AI计算

AI能力景嘉微JM9271AI GPU(参考)
INT8/FP16计算单元Tensor Core / 矩阵单元
CUDA兼容不支持原生支持
OpenCL未提供支持
PyTorch/TensorFlow无法直接调用原生支持
通用计算仅OpenGL Compute Shader完整GPGPU

   景嘉微的价值不在于AI算力,而在于军工可靠性——在-55°C的高原哨所、在电磁干扰密集的舰载指挥舱、在震动剧烈的装甲车终端,景嘉微的GPU能稳定运行十年以上。这种能力是所有AI GPU厂商都不具备的。

在-55℃的高原哨所、电磁干扰密集的舰载指挥舱、震动剧烈的装甲车终端,普通民用GPU可能难以长期稳定运行,但景嘉微的产品却能在这类场景中持续服役十年以上。这种能力不是纸面算力能衡量的,也不是所有AI GPU厂商都能替代的。

从转型方向看,景嘉微正在从“军工图形GPU”逐步拓展到“军工+民用桌面GPU”。目前,JM7200已经进入桌面办公市场,可适配飞腾、龙芯等国产CPU,以及统信UOS、麒麟等国产操作系统。未来,若制程升级和AI能力补强顺利,JM9272+系列有望进一步打开成长空间。


三、摩尔线程:消费级+智算中心双线作战

3.1 "国产GPU第一股"

摩尔线程成立于2020年,创始人袁 Jian 曾担任英伟达全球副总裁、中国区总经理,团队在GPU设计、生态建设和市场推广方面拥有较深积累。

2024年12月5日,摩尔线程正式登陆科创板,成为“国产GPU第一股”,募资规模接近80亿元,上市初期市值一度突破4000亿元。这也意味着,国产GPU企业开始从技术研发阶段走向更成熟的商业化和资本化阶段。

摩尔线程的核心特色是自研MUSA统一系统架构。与很多国产GPU厂商侧重单一算力场景不同,MUSA架构同时覆盖图形渲染、AI计算和视频编解码三大能力,是国产GPU中少数具备“全功能”属性的技术路线。


3.2 MTT S4000:智算中心加速卡

参数MTT S4000NVIDIA A100
架构第三代MUSA(曲院)Ampere
FP3225 TFLOPS19.5 TFLOPS
FP16100 TFLOPS312 TFLOPS
显存48GB80GB HBM2e
显存带宽768 GB/s2.0 TB/s
互联MTLink 240 GB/sNVLink 600 GB/s
CUDA兼容原生CUDA

从参数看,MTT S4000的FP32算力为25 TFLOPS,高于A100的19.5 TFLOPS;但FP16算力为100 TFLOPS,与A100的312 TFLOPS仍有明显差距。这说明摩尔线程在通用计算方面具备较强基础,但在张量计算和AI训练效率上仍有提升空间。

此外,MTT S4000配备48GB显存和768 GB/s显存带宽,相比A100 80GB版本也存在差距。不过,摩尔线程的优势并不只在单卡参数,还在于生态兼容和全栈方案。

目前,MTT S4000支持CUDA生态兼容,能够降低用户从英伟达平台迁移的门槛。同时,摩尔线程还推出了KUAE智算中心解决方案,覆盖硬件、软件、集群管理等环节,类似英伟达DGX的全栈思路,目标是为智算中心客户提供一体化算力支撑。


3.3 MTT S80:消费级显卡

   除了智算中心产品线,摩尔线程还推出了消费级显卡MTT S80——这是国产GPU中少有的面向消费市场的产品。MTT S80的性能约为NVIDIA RTX 4090的30%,支持图形渲染和轻度AI推理。虽然性能与主流游戏卡有较大差距,但它证明了国产GPU可以进入消费市场。


四、昆仑芯:百度系的XPU架构

4.1 百度AI生态的硬件底座

昆仑芯脱胎于百度AI芯片部门,2021年独立运营。作为百度系芯片企业,昆仑芯的最大优势不是单点硬件参数,而是与百度AI生态的深度绑定。

尤其是在深度学习框架方面,昆仑芯与飞桨(PaddlePaddle)实现了深度集成。飞桨是国内市场份额较高的AI框架之一,拥有大量企业用户、开发者和行业落地案例。这种软硬协同能力,使昆仑芯在AI推理、大模型落地和百度内部业务场景中具备天然优势。

技术路线上,昆仑芯采用自研XPU-R架构。与华为达芬奇、壁仞壁立仞、燧原邃思等路线不同,XPU架构更强调“AI专用+通用计算兼顾”,但整体更偏向推理场景。也就是说,昆仑芯并不是单纯追求最高单卡算力,而是围绕实际业务推理需求做优化。


4.2 R200参数

参数昆仑芯 R200
架构XPU-R(自研)
制程7nm
INT8256 TOPS
FP16128 TFLOPS
FP3232 TFLOPS
显存16/32GB GDDR6
显存带宽512 GB/s
接口PCIe 4.0 x16
定位数据中心推理

可以看出,R200的定位非常明确:服务AI推理任务。INT8算力256 TOPS、FP16算力128 TFLOPS,能够较好支撑自然语言处理、计算机视觉、语音识别等推理场景。

与高端训练芯片不同,R200采用GDDR6显存而非HBM2e,显存带宽为512 GB/s。这说明昆仑芯的策略并不是盲目堆高带宽和成本,而是在推理场景中寻找性价比与落地效率的平衡。

在集群方案方面,昆仑芯推出R480-X8加速器,通过集成8张R200,可提供2048 TOPS的INT8推理算力。这类方案更适合需要大规模推理部署的场景,比如搜索推荐、内容理解、语音交互、AI客服和大模型应用落地。

在百度内部,昆仑芯已经成为搜索引擎、文心一言等AI产品的重要推理加速底座。这也说明,昆仑芯的价值不只在于芯片本身,而在于与百度业务场景的长期验证和协同优化。

微信图片_2026-08-26_105513_900.png

五、四家厂商对比与国产GPU全景总结

5.1 定位差异

维度天数智芯景嘉微摩尔线程昆仑芯
定位GPGPU训推一体军工图形GPU全功能GPUAI推理专用
主力产品智铠100/天垓100JM9271MTT S4000R200
FP3224T~1T25T32T
INT8384T未公开256T
制程7nm28nm7nm7nm
CUDA兼容框架兼容不支持飞桨原生
上市状态已上市创业板已上市科创板已上市未上市
核心场景云端训练+推理军工/桌面办公智算中心+消费级百度生态推理




微信图片_2026-08-26_105517_932.png

5.2 国产GPU全景总结

   经过第7-10篇的深入分析,我们可以对国产GPU主要厂商做一个六维能力总结:


厂商单卡算力软件生态互联能力制程量产核心优势
华为昇腾★★★★★★★★★★★★★★★★★★★★★全栈自研+系统级
海光DCU★★★★★★★★★★★★★★★★兼容ROCm+FP64
壁仞★★★★★★★★★★★★★★★单卡算力最强
沐曦★★★★★★★★★★★★★★★CUDA兼容最佳
摩尔线程★★★★★★★★★★★★★★全功能+消费级
天数智芯★★★★★★★★★★★★★训推一体


5.3 三条启示

通过对这四家企业的分析,可以得到三条比较明确的启示。


第一,没有全能选手,只有细分王者。

目前,没有任何一家国产GPU企业能够在算力、制程、软件生态、互联能力、消费级市场、数据中心市场等所有维度上全面领先。

华为系统级能力最强,但制程受限;壁仞单卡算力突出,但生态仍需建设;沐曦CUDA兼容能力较强,但互联和量产节奏仍需观察;景嘉微军工可靠性强,但AI能力较弱;摩尔线程和天数智芯也都有自己的优势边界。

这说明,国产GPU产业不是靠某一家公司就能完成全部替代,而是需要不同厂商在不同场景中各自突破。


第二,软件生态才是长期护城河。

GPU竞争从来不是只比硬件参数。真正决定用户迁移意愿的,是软件生态是否成熟、开发成本是否足够低、现有模型是否能快速跑起来。

华为CANN和MindSpore代表了全栈自研路线,自主性强,但学习门槛较高;沐曦MXMACA强调CUDA兼容,能降低用户迁移成本;摩尔线程则通过CUDA兼容和KUAE方案推进智算中心落地。

未来,谁能率先形成“开发者愿意迁移、模型能够适配、性能持续优化”的闭环,谁才有可能在国产GPU竞争中真正活下来。


第三,量产交付比纸面参数更重要。

国产GPU行业有一个常见现象:发布会参数亮眼,但真正走向客户环境后,还需要经历漫长的打磨期。

例如,壁仞BR100在2022年发布,但直到2025年才逐步实现量产;景嘉微JM9系列最初目标较高,最终受限于制程、成本和架构积累,实际性能出现缩水。

这说明,从“发布一款芯片”到“客户真正能用”,通常需要2到3年时间。期间可能遇到制程降级、良率不足、性能优化不及预期、软件适配缓慢等问题。


因此,评价一家国产GPU企业,不能只看发布会参数,更要看它是否能稳定交付、持续迭代,并在真实业务场景中跑通。


结语

国产GPU的发展,正在从“单点突破”走向“体系化突围”。

天数智芯的训推一体、景嘉微的军工可靠性、摩尔线程的消费级与智算双线布局、昆仑芯的百度生态推理路线,代表了国产GPU产业中几种不同的生存策略。

它们不一定都追求全面替代英伟达,也不一定都要做最强算力,但都在各自的优势领域建立了不可替代性。

从下一篇开始,我们将从技术维度继续拆解国产GPU面临的共性挑战,包括制造瓶颈、软件生态短板和AI框架适配问题。


本文数据来源:天数智芯官网/BAIA智源社区/界面新闻/腾讯云;景嘉微百度百科/CSDN技术博客/EET-China;摩尔线程官网/知乎/百度文库;昆仑芯百度百科/知乎/CSDN。数据截至2025年12月。

上一篇
赴沪观潮,智启新程|安徽云联万佳团队出席 2026 WAIC 物理智能创新生态论坛,共探国产物理 AI 产业新机遇

相关推荐

新兴厂商:沐曦
新兴厂商:沐曦

2026-08-14

北京发布全国首个标准化 Token(词元)工厂
北京发布全国首个标准化 Token(词元)工厂

2026-07-09

七问+一图,读懂《“人工智能+信息通信”创新发展实施意见(2026—2028年)》
七问+一图,读懂《“人工智能+信息通信”创新发展实施意见(2026—2028年)》

2026-07-06

央视《朝闻天下》走进芜湖集群实地调研 探索多元算力前瞻布局
央视《朝闻天下》走进芜湖集群实地调研 探索多元算力前瞻布局

2026-06-08

微信二维码
微信咨询
扫码添加企业微信
获取专属服务方案
微信号:yunlianwanjia
电话