很多朋友很困惑:面对满屏参数的GPU规格表,TFLOPS、HBM、CUDA核心、TDP、NVLink这些专业名词到底是什么意思?
哪些参数决定真实性能?哪些是厂商的宣传噱头?
本期我们搭建一套五大核心维度GPU参数解读体系:算力、存储、互联、功耗、制程。掌握这套框架,无论面对哪款GPU的参数表,都能快速甄别优劣、看透真实实力,不再被花哨数字误导。

1、算力:TFLOPS到底怎么算?
TFLOPS是GPU最核心的算力指标,全称“每秒万亿次浮点运算”,是衡量GPU计算能力的通用标准。但绝大多数人都踩过一个坑:脱离精度谈TFLOPS,毫无意义。不同浮点精度下的算力数值,差距可达数十倍。
1.1 精度等级:从FP64到FP4
浮点精度由位宽决定,位宽越大,计算结果越精准,但硬件算力上限越低;反之低精度算力更高,仅会小幅损失计算精度。而AI行业的核心实践证明:绝大多数大模型训练、推理任务,对精度敏感度极低,低精度运算完全可以保证模型准确率。
我们以英伟达A100、H100两代旗舰GPU为例,直观对比不同精度的算力差异:
| 精度 | 位宽 | 典型用途 | A100 TFLOPS | H100 TFLOPS | 精度越低算力倍数 |
|---|---|---|---|---|---|
| FP64 | 64位 | 科学计算(HPC)、天气模拟、分子动力学 | 9.7 | 34 | 基准 |
| FP32 | 32位 | 通用计算、图形渲染、深度学习早期 | 19.5 | 67 | 2x |
| TF32 TC | 19位(等效) | AI训练(Ampere+Tensor Core) | 156 | 989 | ~8x |
| FP16/BF16 | 16位 | AI训练主力(混合精度训练) | 312 | 1,979 | ~16x |
| FP8 | 8位 | AI推理(Hopper+Transformer Engine) | — | 3,958 | ~32x |
| FP4 | 4位 | AI推理(Blackwell,压缩模型) | — | — | ~64x |
不难发现,H100的FP64高精度算力仅34 TFLOPS,而FP16算力高达1979 TFLOPS,两者差距足足58倍。这也是厂商发布会偏爱宣传低精度峰值算力的核心原因——数字视觉冲击力更强,更容易造成“性能翻倍”的错觉。
场景选型口诀:科学计算用FP64、深度学习训练用FP16/BF16混合精度、大模型推理优先FP8、极致压缩推理可选用FP4。看算力参数,一定要先匹配自身业务场景。
1.2 CUDA Core vs Tensor Core
Tensor Core(张量核心)是英伟达专为AI矩阵乘加运算定制的硬件单元,算力远超传统CUDA核心。同等硬件条件下,张量核心加持的FP16算力,是纯CUDA核心计算的8-16倍,也是上表算力倍增的核心原因。
但必须注意:张量核心存在使用门槛,仅支持特定指令集与数据格式。如果项目代码未适配混合精度运算,张量核心会完全闲置,无法发挥任何性能优势。
这也是英伟达持续迭代CUDA、TensorRT生态的核心目的:硬件算力天花板足够高,最终性能上限,取决于软件能否充分释放硬件潜力。
2、存储:80GB显存到底够不够?
再强悍的算力,没有充足的数据供给也无从发挥。如果显存读写速度跟不上核心计算速度,GPU算力会持续闲置,这就是行业经典的“内存墙”难题。显存的容量、类型、带宽,直接决定GPU的实际落地性能。
2.1 显存容量:决定你能跑多大的模型
显存容量的核心作用,是限定单张GPU能够加载、运行的模型规模。行业通用显存估算公式:
模型显存 ≈ 参数数量 × 精度字节数 × 并行开销系数
举个典型案例:GPT-3模型拥有1750亿参数,采用FP16精度存储仅需350GB显存。但实际混合精度训练中,需要同时存储FP16权重与FP32梯度,叠加2.5-3倍的并行开销,整体显存需求高达800-1000GB,远超H100 80GB的单卡显存容量。这也是超大模型训练必须依赖多卡集群并行的核心原因。
从行业迭代来看,GPU显存容量持续升级:A100 80GB、H200 141GB、B200 192GB,但大模型参数规模的增长速度,始终快于显存扩容速度,显存容量永远处于供不应求的状态。
2.2 显存类型:为什么GPU不用DDR?
消费级电脑普遍使用DDR4/DDR5内存,而数据中心GPU早已全面普及HBM高带宽内存。核心差距在于硬件架构:DDR内存为平面布局,读写通路有限;而HBM依托TSV硅通孔技术,将多层DRAM芯片垂直堆叠,通过硅中介层与GPU芯片紧密贴合。
这种架构带来了碾压级的带宽优势:HBM3e单堆栈带宽可达1200GB/s,而主流DDR5内存带宽仅50GB/s左右,差距高达20倍以上。

2.3 显存带宽:比容量更关键的指标
多数人选购GPU只看显存大小,实则显存带宽才是AI训练、推理速度的核心瓶颈。模型迭代过程中,GPU需要反复读取、计算、回写数据,带宽不足会直接导致算力闲置、训练速度卡顿。
三代英伟达旗舰GPU显存性能对比:
| GPU | 显存类型 | 容量 | 带宽 | 带宽提升 |
|---|---|---|---|---|
| A100 | HBM2e | 80 GB | 2.04 TB/s | — |
| H100 | HBM3 | 80 GB | 3.35 TB/s | 1.64x |
| H200 | HBM3e | 141 GB | 4.8 TB/s | 2.35x |
| B200 | HBM3e | 192 GB | 8 TB/s | 3.9x |
H200与H100架构基本一致,仅升级显存规格,却实现了1.4-1.8倍的推理性能提升,足以证明带宽的核心价值。
这也是当前国产GPU的核心痛点:国内芯片设计能力已逐步追赶,但HBM高带宽内存技术被三星、SK海力士、美光三家企业垄断,且受出口管制限制。即便国产GPU核心算力达标,也会因带宽不足无法释放全部性能。
3、互联:NVLink为什么比PCIe强这么多?
单卡GPU性能存在固定上限,超大模型训练必须依靠多卡并行集群。而多卡集群的整体效率,不取决于单卡算力,而取决于GPU之间的数据互联速度。
如果将PCIe总线比作城市双向两车道普通公路,拥堵频发、通行效率有限;那NVLink就是专属高速通道,无拥堵、点对点直达、多车道并行,带宽上限远超PCIe。

英伟达NVLink协议持续迭代,带宽性能稳步翻倍:P100的NVLink1.0(160GB/s)→A100的NVLink3.0(600GB/s)→H100的NVLink4.0(900GB/s)→B200的NVLink5.0(1800GB/s),每两年完成一次性能翻倍,完美匹配GPU算力增长节奏。
多卡训练场景下,互联带宽的差距会被无限放大。以GPT-3训练为例,模型迭代需要频繁完成多卡梯度同步(all-reduce操作),PCIe5.0总线会产生严重的通信瓶颈,大幅拖慢训练进度;而NVLink4.0可将通信耗时压缩至几乎可以忽略。这也是英伟达DGX/HGX多卡服务器全系标配NVLink背板的核心原因。
国产GPU的核心短板:目前多数国产GPU依赖通用PCIe总线,自研高速互联协议尚未成熟。华为昇腾HCCS自研互联协议带宽约400GB/s,仍落后于NVLink3.0,高速互联技术,是制约国产多卡集群性能的关键命门。
4、功耗与能效:TDP不是电费账单
TDP热设计功耗,指GPU满负载运行的最大功耗阈值。H100功耗700W、B200功耗1000W,看似功耗极高,但结合算力涨幅来看,制程与架构升级带来的能效提升极为显著。评判GPU功耗,核心看能效比(单位功耗产出算力),而非功耗绝对值。
| GPU | TDP | FP16 TFLOPS | 能效比(TFLOPS/W) |
|---|---|---|---|
| A100 | 400 W | 312 | 0.78 |
| H100 | 700 W | 1,979 | 2.83 |
| B200 | 1,000 W | ~2,250 | ~2.25 |
从数据可见,H100能效比是A100的3.6倍,同等功耗下算力提升3.6倍,这就是架构优化和先进制程的结构红利。B200采用双芯片MCM封装设计,能效比略有回落,但单卡整体吞吐量依然实现大幅跃升。
从落地成本来看,8卡H100整机服务器满载功耗约8kW,按商业电价1元/度、24小时运行计算,单月仅电费就超5700元,还未包含散热、运维成本。这也是国内算力中心多选址于贵州、内蒙古等低价电价区域的核心原因。
5、制程工艺:晶体管越多,性能越强?
芯片制程节点(7nm/5nm/4nm),代表晶体管最小特征尺寸。制程越先进,同等芯片面积可集成更多晶体管,或同等晶体管数量下功耗更低、性能更强。
| GPU | 架构 | 制程 | 晶体管数 | Die面积 |
|---|---|---|---|---|
| A100 | Ampere | TSMC 7nm | 542亿 | 826 mm² |
| H100 | Hopper | TSMC 4N | 800亿 | 814 mm² |
| B200 | Blackwell | TSMC 4NP | 2,080亿 | 双Die |
A100与H100芯片面积几乎一致,但H100凭借台积电4N定制工艺,将晶体管数量提升47%,实现性能跨越式升级。
而B200采用当下主流的MCM多芯片封装方案,将两颗芯片集成至同一封装体,突破了单芯片光刻面积上限(台积电最大光刻面积约800mm²),这也是高端GPU的未来发展趋势。
国产制程困境与突破口:国内量产物料最先进的7nm(N+2)工艺,与台积电4N/3nm工艺存在2-3代差距,直接导致国产GPU晶体管密度、能效比偏弱。但Chiplet芯粒技术为国内提供了弯道超车的路径,通过先进封装拼接多颗小芯片,可媲美高端单大芯片的性能,也是国产算力芯片的核心发展方向。
6、综合对比:一张参数表看全三代GPU
我们通过一张总表,全景对比A100、H100、B200三代旗舰GPU核心参数,清晰梳理迭代规律:
| 参数 | A100 SXM4 | H100 SXM5 | B200 SXM |
|---|---|---|---|
| 架构 | Ampere | Hopper | Blackwell |
| 制程 | TSMC 7nm | TSMC 4N | TSMC 4NP |
| 晶体管 | 542亿 | 800亿 | 2,080亿 |
| SM数量 | 108 | 132 | — |
| CUDA Core | 6,912 | 16,896 | — |
| Tensor Core | 第3代 (432个) | 第4代 (528个) | 第5代 |
| FP64 TC | 19.5 TF | 67 TF | ~90 TF |
| FP16 TC | 312 TF | 1,979 TF | ~2.25 PF |
| FP8 | — | 3,958 TF | ~4.5 PF |
| 显存 | 80GB HBM2e | 80GB HBM3 | 192GB HBM3e |
| 带宽 | 2.04 TB/s | 3.35 TB/s | 8 TB/s |
| NVLink | Gen3, 600 GB/s | Gen4, 900 GB/s | Gen5, 1.8 TB/s |
| TDP | 400 W | 700 W | 1,000 W |
| 发布年份 | 2020 | 2022 | 2024 |
从三代GPU迭代,可总结出三大核心趋势:
1. 算力指数增长:单代算力提升5-7倍,低精度AI算力迭代尤为激进;
2. 带宽持续追赶:显存带宽稳步升级,但增速始终滞后于算力,内存墙长期存在;
3. 架构范式革新:单芯片性能逼近物理极限,多芯片MCM封装、Chiplet技术成为行业必然趋势。
7、参数之外,还需要看什么?
纸面参数是硬件硬实力,但实际选型、落地采购中,四大软实力同样至关重要:
- 1. 软件生态CUDA生态是英伟达最大的护城河,积累了海量开发者与成熟代码库。国产GPU即便硬件参数追平,缺乏完善的软件适配与生态支持,依然难以大规模落地,生态建设是国产算力的长期课题。
- 2. 供货与迭代稳定性数据中心建设需要长期稳定的供货与清晰的产品迭代路线。英伟达拥有透明的产品线规划,而多数国产厂商产品迭代路线尚不明确,这也是金融、政务等刚需稳定场景采购偏保守的核心原因。
- 3. 安全合规属性涉密、政企核心场景对算力设备有严格合规要求,需要支持国密算法、可信计算。英伟达GPU无原生国密支持,而昇腾、海光等国产GPU硬件级集成国密引擎,是国产化替代的核心差异化优势。
- 4. 综合性价比目前H100单卡市场价20-25万元,且受制裁影响供货紧缺、价格浮动大;昇腾910B等国产GPU单价12-15万元,硬件算力可达H100的60%-70%。单纯硬件性价比已逐步追赶,但叠加软件适配、运维、生态成本后,整体拥有成本仍有差距。
写在最后
读懂GPU参数的核心,不是熟记数字,而是理解数字背后的硬件逻辑与场景适配性。记住这套核心解读顺序:先看精度匹配场景、再看显存容量与带宽、其次核对互联能力、最后评估功耗与制程能效,轻松甄别所有GPU参数优劣。
思考题:如果搭建GPT-3级别大模型训练集群,你会选择A100、H100还是国产GPU?欢迎在评论区分享你的观点!
安徽云联万佳信息科技有限公司