HBM,全称是 High Bandwidth Memory,也就是高带宽内存。简单来说,它是一种专门为高性能计算设计的内存技术。现在主流 AI GPU,例如 NVIDIA H100、H200、B200 等,都大量采用 HBM,核心原因就在于 AI 模型运行时不仅需要很大的显存容量,还需要 GPU 在短时间内读取和写入海量数据。

新思推出业界首个 HBM3 内存设计解决方案,带宽高达921GB/s | ScenSmart|OEM|ODM|行业方案

传统 GPU 显存主要使用 GDDR,而 HBM 的结构和连接方式不同。HBM 会把多层 DRAM 芯片进行垂直堆叠,再通过 TSV(硅通孔)等技术进行高速连接,并通过非常宽的接口与 GPU 连接。这样做可以在较高数据传输效率的情况下,实现非常大的内存带宽。

What's the Difference Between GDDR and DDR Memory? | Exxact Blog

为什么 AI GPU 特别需要 HBM?首先是 AI 计算的数据量非常大。以大模型推理为例,GPU 在计算过程中需要不断读取模型参数、输入数据以及中间计算结果。如果显存带宽不足,GPU 的计算能力再强,也可能因为数据供给速度跟不上而降低实际利用率。

其次,AI GPU 的计算规模越来越大。现在一张高端 AI GPU 可以提供非常高的 FP16、BF16、FP8 等计算性能,对显存带宽的要求也越来越高。HBM能够提供远高于普通显存的带宽,因此更适合训练和推理大模型。

8384aae0bcfc8e724d2b3cf78ef67200.png

第三,HBM可以在有限的封装空间内提供较大的带宽。GPU 与 HBM 通常采用先进封装技术进行集成,GPU 和内存之间的物理距离更短,连接接口也非常宽,可以减少高速数据传输过程中受到的限制。

当然,HBM也不是只有优点。它的制造工艺、先进封装和测试要求都比较高,成本也明显高于普通显存。同时,HBM的供应能力还会受到晶圆、堆叠工艺和先进封装产能的影响,所以高端 AI GPU 的成本中,HBM本身就是一个重要组成部分。

从实际应用来看,HBM已经成为高端 AI GPU 的重要组成部分。可以简单理解为:GPU负责进行大量计算,而HBM负责持续提供这些计算需要的数据。对于 AI 训练和推理来说,计算性能和显存带宽需要同时提升,只增加 GPU 算力而不提高内存带宽,整体性能也很难充分发挥。

所以,AI GPU 普遍使用 HBM,并不是单纯为了增加显存容量,更重要的是满足大模型时代对高带宽、低延迟、高数据吞吐的需求。随着模型规模和 GPU 算力继续提升,HBM的重要性也会越来越高。