AI 算力参考
参考手册AI 加速器吞吐量(FLOPS/TOPS)、精度格式与算力单位定义。
算力单位
精度格式
加速器类型
硬件
| 名称 | 厂商 | 架构/工艺 | 显存 | 带宽 | FP16/BF16 (TF) | FP8 (TF) | INT8 (TOPS) |
|---|
所列数据均为厂商数据手册中的理论峰值(稠密)。实际持续吞吐量更低,且训练与推理存在差异。FLOPS 与 TOPS 衡量不同的运算类型,无法直接换算。
本页内容
什么是 AI 算力硬件参考表?#
当你看到某块 GPU “达到 1979 TFLOPS”、某颗芯片”显存 192 GB”时,这些数字只有在搞清背后规则后才有意义:是在哪种数值精度下测的、有没有算上结构化稀疏、是浮点吞吐(TFLOPS)还是整型吞吐(TOPS)、显存实际能供多少带宽。厂商公布旗舰数字时总挑对自己最有利的口径;没有一份讲清前提条件的参考,两颗芯片根本没法诚实比较。
本页就是这份参考。它把 ML 工程师、基础设施采购真正需要的四样东西并排放在一起:算力单位词表(FLOPS、TFLOPS、TOPS、MAC 到底什么意思)、数值精度格式(从 FP64 一路到 INT4,按典型吞吐顺序排)、加速器类型(CPU、GPU、TPU、NPU、LPU、MAU)、以及一张硬件表——具体芯片的显存容量、显存带宽、以及 FP16、FP8、INT8 三档稠密峰值吞吐,每个数字都核对过厂商数据手册,凡是有可能误导的地方都明确注明前提。
怎么使用#
- 一处搜索,过滤全部。 顶部唯一的搜索框按名称、厂商、工艺节点或规格同时过滤四个分区——输
H100、NVIDIA、192gb、4.8tb/s都能收窄硬件表。 - 读这四个分区。
- 算力单位 —— 带 SI 前缀的符号(FLOP 到 EFLOPS,外加 TOPS、MAC)及其十进制指数,方便你换算。
- 精度格式 —— FP64、FP32、TF32、FP16、BF16、FP8、INT8、INT4,各自位宽和典型用途,大致按现代张量核上吞吐由低到高排列。
- 加速器类型 —— CPU、GPU、TPU、NPU、LPU、MAU 各自一句话的区别。
- 硬件表 —— 名称、厂商、工艺、显存(GB)、显存带宽(TB/s)、稠密 FP16/FP8/INT8 吞吐,每颗芯片附一句注意事项。
- 空单元格可信。 某格为空而不是 0,说明该数字无法作为稠密峰值核实——备注会解释原因(AMD MI300X 公布的是稀疏峰值,稠密大约减半)。与其印一个带隐藏前提的数字,不如留空更诚实。
主要特性#
- 只列稠密峰值,稀疏另注。 NVIDIA 的数字都是稠密(不含 2:4 结构化稀疏);备注提醒你,它们营销上的旗舰数字开了稀疏后往往会翻倍。绝不悄悄”带稀疏”注水。
- TFLOPS 与 TOPS 分开。 词表里明说 TOPS(OPS 家族)与 TFLOPS(FLOPS 家族)不可直接比较——这正是厂商爱钻的空子。
- 四档精度按吞吐排序。 一眼可见:同一架构下 FP8 大致是 FP16 的两倍、INT8 大致是 BF16 的两倍——这就是量化之所以存在的经济动因。
- 显存与带宽也算一等公民。 对大语言模型推理而言,显存容量和带宽往往比峰值 FLOPS 更要命,所以它们是独立列。
- 来源只具名、不带链接。 每个数字都写明出自哪份数据手册或产品页,但不放外链 URL,你可以拿去跟厂商自己的文档逐一对账。
实例演示#
用硬件表把 NVIDIA 三代并排比较。搜 NVIDIA,A100、H100、H200 三行一起出现:
| 芯片 | 显存 | 带宽 | FP16 稠密 | FP8 稠密 | INT8 稠密 |
|---|---|---|---|---|---|
| A100 80GB SXM | 80 GB | 2.0 TB/s | 312 TFLOPS | — | 624 TOPS |
| H100 SXM5 | 80 GB | 3.35 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
| H200 SXM | 141 GB | 4.8 TB/s | 989 TFLOPS | 1979 TFLOPS | 1979 TOPS |
两件事一目了然。第一,H100 到 H200 算力毫无增长——两者用的是同一颗 GH100 计算核;H200 只是把显存升级到 HBM3e,容量近乎翻倍(80 → 141 GB)、带宽大涨(3.35 → 4.8 TB/s)。对一个显存受限的 LLM 推理负载来说,这比加 FLOPS 收益更大。第二,A100 没有 FP8 列——FP8 是 Hopper 这一代才有的特性,Hopper 之前的芯片压根没有。
再调出 AMD 和 Google 的行。MI300X 的显存(192 GB)和带宽(5.3 TB/s)是全表最大,但它的 FP16/FP8/INT8 单元格刻意留空,备注解释 AMD 公布的是带结构化稀疏的峰值(FP16 稀疏 1307、INT8 稀疏 2614),而稠密大约只有一半——把稀疏数印在 NVIDIA 的稠密数旁边会是误导性比较。TPU 那几行又是另一套口径:TPU v4 报 BF16 与 INT8 相等、都是每核 275,而主打性价比的 v5e 把 INT8 翻到 393、BF16 是 197。
常见问题#
TFLOPS 和 TOPS 是一回事吗?#
不是,混淆这两者是规格表里最常见的坑。TFLOPS 量的是每秒浮点运算次数(FLOPS 家族,十进制前缀:MFLOPS、GFLOPS、TFLOPS、PFLOPS)。TOPS 量的是每秒整型或通用运算次数(OPS 家族),INT8 量化推理时你看到的常常就是这个。因为底层运算不同,一颗芯片的 TOPS 数跟它的 TFLOPS 数不可直接比较;而 MAC(一次乘加)按惯例算作两次 FLOP,这也是厂商的 TOPS 数字有时看着像重复计数的原因之一。
为什么 MI300X 的算力单元格是空的?#
因为 AMD 公布的峰值吞吐是开了结构化稀疏的(比如 FP16 稀疏 1307 TFLOPS),而本表为让所有芯片口径一致,统一报稠密峰值。MI300X 的稠密大约是稀疏的一半,但一份干净的、经核实的稠密数字并不稳定可得,于是宁肯留空,也不印一个藏着”稀疏”前提的数字。它的显存和带宽——192 GB、5.3 TB/s——是核实过的,照常显示。
FP16 和 BF16 有什么区别?#
两者都是 16 位,但位的分配不同。FP16 精度更高、但数值范围窄;BF16 用精度换了跟 FP32 一样的范围。这个范围对训练很关键——梯度数量级可能剧烈波动——所以 BF16 已经成为现代张量核上训练的默认格式,哪怕它和 FP16 占同样位宽。精度格式分区里两者都列、并附典型用途。
“峰值”是什么意思,我的模型真能跑到这个数吗?#
几乎不可能。这些是理论峰值——假设每个周期都被完美利用、没有显存停顿,芯片能持续输出的吞吐;真实负载永远达不到。实际持续吞吐永远更低,取决于算子实现、模型架构、batch size,以及负载到底是显存受限还是算力受限。把峰值当作”比较架构上限”的标尺就好,别当成”我的模型会跑多快”的预测。