NVIDIA 推出了 Quantum-X800 InfiniBand 交换机,这是 AI 基础设施 领域的一项突破。这款高性能交换机提供 144 个 800 Gb/s 端口,专为连接现代 美国服务器 部署中的大规模 GPU 集群而设计。你可以消除 AI 训练和推理中的数据瓶颈,从而加快模型开发速度,实现更大规模的部署。

800G InfiniBand 交换机代表了网络性能的一次飞跃。凭借亚 100 纳秒的端口到端口时延,以及通过 SHARP v4 实现的 14.4 TFLOPS(万亿次浮点运算)的网络内计算能力,Quantum-X800 平台树立了新的标准。800G InfiniBand 技术直接支撑着日益增长的 GPU 计算需求。

这款交换机通过为下一代数据中心提供骨干网络,推动了 AI 时代的演进。NVIDIA 的创新,使你能够构建为未来 AI 工作负载做好准备的基础设施。

要点速览

  • 全新的 NVIDIA 交换机采用 800G InfiniBand,消除 AI 训练中的数据瓶颈。
  • SHARP v4 技术从 GPU 中卸载部分工作,使训练速度提升 9 倍。
  • 该交换机可连接超过 10,000 块 GPU,并能在标准数据中心中运行,无需特殊散热。
  • 它具备更低的功耗并支持未来的 AI 模型,使你的基础设施具备可持续扩展能力。

为何 AI 需要 800G InfiniBand

AI 数据中心的瓶颈

AI 模型以惊人的速度增长。自 2010 年以来,这些模型的参数数量大约每年翻一番。早期的模型(如 Theseus)只有 40 个参数,GPT-3 已经达到 1750 亿,而 QMoE 模型则超过 1.6 万亿。这样的指数级增长需要能跟上节奏的网络基础设施。

在分布式训练过程中,你的 GPU 集群会面临关键挑战。梯度同步以及 All-Reduce、All-Gather 等集合通信操作,可能消耗总训练时间的 40–60%。这些操作对带宽、时延、抖动和拥塞控制极为敏感。即便是轻微劣化,也会造成 GPU 利用率大幅下降。微秒级的抖动就可能让分布式训练性能降低 30% 甚至更多。

标准的 400G 以太网网络在这里显得力不从心。瓶颈不在于名义速率,而在于协议开销。如果没有 RDMA 支持,这类网络往往存在较高时延、丢包和交换机拥塞等问题。每一个问题都会直接拖慢分布式训练中的同步步骤,最终导致 GPU 空转,等待迟迟到达的梯度和参数。

用 InfiniBand 将带宽提升一倍

InfiniBand 从设计理念上就针对这些问题给出了答案。它提供分布式 AI 工作负载所需的超低时延和无损通信。现代采用 RoCEv2 的 400G 以太网在部分任务上可以与 InfiniBand 媲美,Meta 使用 24,000 块 GPU 训练 Llama 3 即是典型案例。不过,对缺少 RDMA 的标准以太网而言,其不足是根本性的——10 GbE 比 InfiniBand NDR 慢了 40 倍。

800G InfiniBand 交换机将你的 AI 基础设施可用带宽提升了一倍。这一飞跃意义重大,因为集合通信性能几乎与网络容量成正比。更高带宽意味着更快的梯度在数千块 GPU 间完成交换,更低时延则意味着处理器的空闲时间更少。

长期以来,InfiniBand 一直是高性能计算(HPC)环境中首选的互连技术。其低时延和高吞吐,使其非常适合大规模并行计算。800G InfiniBand 技术将这一优势扩展到了 AI 时代。NVIDIA 针对大规模 AI 训练工作负载对该平台进行了专门优化。

对于 HPC 集群和 AI 数据中心而言,选择非常明确:你需要的是一种能消除瓶颈,而不是制造新瓶颈的互连。Quantum-X800 提供 144 个 800 Gb/s 端口,正是为此而生。这款交换机让你的基础设施为下一波 AI 创新做好了准备。

NVIDIA 800G InfiniBand 交换机特性

无与伦比的吞吐和端口密度

Quantum-X800 平台提供两种不同机箱,以匹配你的部署需求。Q3200-RA 采用 2U 机型,内置两个独立的 28.8 Tb/s 交换芯片。该型号通过 36 个 OSFP 插槽提供 72 个 XDR 端口,总吞吐量最高可达 57.6 Tb/s。Q3400-RA 使用 4U 机箱,通过 72 个 OSFP 插槽提供 144 个 XDR 端口,其总吞吐量高达 115.2 Tb/s。两款机型均基于 Quantum-3 交换芯片,并搭载 Intel CFL i3-8100H 处理器。

你可根据需求灵活配置端口速率:在 Q3200-RA 上,每个端口的速率范围为 40 Gb/s 至 800 Gb/s;Q3400-RA 支持每端口 400 Gb/s 或 800 Gb/s。这一 800Gbps 网络能力将上一代产品的带宽直接翻倍。800G InfiniBand 交换机技术使端到端连接达到了前所未有的速度。

对于大规模 AI 集群而言,端口密度同样至关重要。Q3400-RA 相比早期交换机具有明显优势:

交换机型号端口数量端口速率
Q3400-RA144800 Gb/s
QM970064400 Gb/s
QM870040200 Gb/s

对比可以看出,端口数量相较 QM9700 提升了 2.25 倍,相较 QM8700 则提升了 3.6 倍。Q3400-RA 的高 radix(高端口数)设计,允许你构建两层 fat tree 拓扑,将多达 10,368 个网卡在最低时延条件下互联,为最苛刻的工作负载提供最佳作业局部性。

Q3400-RA 还采用风冷设计,可直接部署在现有数据中心中,无需进行重大基础设施改造。机箱配置 8 个可更换电源模块和 10 个可更换风扇,便于维护。两款机型均提供 USB 2.0 Type-A 接口、管理端口和控制台接口,便于日常运维管理。

搭载 SHARP v4 的先进网络内计算能力

800G InfiniBand 平台引入了新一代网络内计算技术 SHARP v4。该协议通过将集合操作卸载到交换网络本身,加速了相关计算过程,从而减少数据在网络中的往返,同时提升整体效率。

与前一代 SHARP 技术相比,SHARP v4 带来了 9 倍的网络内计算性能提升。这一改进直接加快了 AI 训练周期。对于基于 NCCL 的工作负载,使用 SHARP 加速的集合通信可带来最高 2.5 倍的性能提升。由于梯度同步不再成为瓶颈,你的大型语言模型训练速度也随之提升。

该交换机还集成了增强型自适应路由功能,可针对动态流量模式优化路径选择。基于遥测的拥塞控制利用实时网络数据,在拥塞发生前进行预防。这些能力协同工作,即使在高负载情况下也能保持亚 100 纳秒的端口到端口时延。

NVIDIA 也为 Quantum-X800 平台设计了出色的可靠性机制。自愈式网络结构提供目前最快的恢复机制,在链路故障时可实现 1,000 倍更高的弹性。即便单个连接出现问题,你的基础设施仍能保持稳定运行。

超低时延与高吞吐的组合,使这款交换机非常适合高性能计算环境。HPC 集群需要在成千上万节点之间维持一致的性能表现。Quantum-X800 平台能够在两层 fat tree 拓扑中支撑超过 10,000 个节点,这一规模远超上一代产品可支持的集群大小。

对于 AI 工作负载而言,收益不仅在于速度。与早期型号相比,该交换机降低了每比特能耗。在保持卓越性能的同时,你可以实现更高的每瓦计算能力。Quantum-X800 平台还提供 Quantum-X Photonics 选项,将光学模块直接集成到交换芯片中,进一步降低能耗和时延。

这款 800G InfiniBand 交换机为现代 AI 基础设施提供了完整解决方案。你将获得满足前沿研究和生产系统所需的带宽、智能与可靠性。

800G InfiniBand 对 AI 的优势

加速 AI 训练和推理

Quantum-X800 InfiniBand 交换机在大型语言模型训练效率方面实现了 9 倍提升。这得益于 NVIDIA 的 SHARP v4 协议,该协议在交换机上直接执行网络内数据聚合和集合操作。通过将这些通信任务从服务器侧卸载出去,交换机降低了通信瓶颈与服务器负载,从而显著加快万亿参数模型的训练循环。

你还能获得显著的能效改善。该交换机使用共封装光学技术,取消了可插拔光模块。这种设计简化了物料清单并降低了成本,其能效是传统可插拔光模块的 5 倍。由于无需 DSP 重定时芯片,网络侧的功耗大幅降低。这一降耗直接减少了 AI 数据中心的总体拥有成本,在整个基础设施生命周期内会累积成可观的运营收益。

指标改进幅度
能效比可插拔光模块高 5 倍
持续 AI 应用运行时间弹性提升 5 倍
洞察时间(Time to insight)部署速度提升 1.3 倍

这三个指标凸显了 Quantum-X800 平台在运营层面的优势。由于省去了 DSP 重定时芯片,该交换机也能进一步降低时延。对于大规模 AI 训练来说,这种超低时延至关重要,每一微秒都很宝贵。你的 GPU 将花更少时间等待数据,而把更多时间用于计算。InfiniBand 架构提供了标准以太网难以实现的无损通信,确保训练作业不会因丢包或网络拥塞而被打断。最终成果是:更快的模型开发周期以及更高的整集群 GPU 利用率。

借助 NVIDIA Quantum-X800 实现可扩展性

Quantum-X800 平台支持从小型研究实验室到超大规模数据中心的平滑扩展。与上一代产品相比,NVIDIA 的交换机在可扩展性方面具有显著优势。

特性Quantum X800QM9700(上一代)
每台交换机端口数144(800 Gb/s)64(400 Gb/s)
最大主机连接数(两层 Fat-Tree)>10,000(800 Gb/s)
网络内计算第四代 SHARP(支持 FP8)

高端口密度使你能够在两层 fat tree 拓扑中连接超过 10,000 个节点。这样的规模足以承载最大型 AI 工作负载,而无需构建复杂的多层网络设计。随着计算需求的增长,你的云基础设施可以顺畅扩展,每个新增节点都能在不打乱既有工作流的前提下融入集群。

Q3400-RA 采用风冷设计,可与现有数据中心的散热基础设施兼容。

风冷平台仅支持散热鳍片(Finned Top)版本的 1.6T 收发器。平顶(Flat Top)版本依赖冷板导热,只适用于液冷架构。Q3400-RA 采用的是 Finned Top 收发器,这一点印证了其风冷设计以及与现有数据中心散热系统的兼容性。

得益于这种风冷方案,你可以在标准机架中部署 Q3400-RA,而无需液冷系统。4U 机箱可直接放入现有的数据中心机柜中。你也就无需为超大规模数据中心改造散热系统,从而避免了额外的成本与复杂度。这一设计选择使部署过程简单且可预期。

InfiniBand 技术与 NVIDIA 平台设计的结合,使这款交换机非常适合 HPC 环境。其超低时延和高吞吐能够支撑最苛刻的 HPC 工作负载。你可以在同一网络上同时运行 AI 训练任务和传统 HPC 仿真。随着模型规模不断膨胀,这款 InfiniBand 交换机也能满足不断增长的 GPU 计算需求。800 Gb/s 的端口带宽确保 GPU 不会因为数据匮乏而“饿死”。这种可扩展性让你的基础设施为未来的 AI 突破做好准备。

NVIDIA Quantum-X800 平台标志着 AI 网络领域的关键进步。其 800G InfiniBand 技术为你的 AI 工作负载提供前所未有的速度、增强的可扩展性以及更高的效率。这款 800G InfiniBand 交换机彻底消除了拖慢 GPU 训练和推理的网络瓶颈。

NVIDIA 的技术路线图还将这一创新进一步推向前沿。下一代平台 Quantum-X Photonics 将硅光子技术直接集成到交换机封装中,可实现 3.5 倍的能效提升和 10 倍更高的弹性。应用可以在不中断情况下运行更长时间,最长可提升 5 倍。未来的 InfiniBand 连接将向 1.6T 速率演进,以支撑万亿级参数模型。

思考一下这项技术将如何重塑你的数据中心策略。Quantum-X800 平台让你的基础设施在今天就为明天的 AI 突破做好准备。

常见问题(FAQ)

Quantum-X800 与旧款交换机有何不同?

它提供 144 个端口,每个端口支持 800 Gb/s 的 InfiniBand 速率。这款 NVIDIA 交换机采用 SHARP v4 加速集合操作,让大型 AI 模型训练效率提升 9 倍。

SHARP v4 如何提升 AI 训练效率?

NVIDIA 的 SHARP v4 将集合通信从 GPU 卸载到交换网络中。这项 NVIDIA 技术减少了数据移动,在训练工作负载中可实现高达 9 倍的性能提升。

Quantum-X800 能否在现有数据中心中使用?

可以。Q3400-RA 采用风冷设计,可直接部署在标准机架中,无需液冷系统。这使其能够轻松集成到超大规模数据中心和现有云基础设施中。

这款交换机如何支撑大型 AI 集群?

Quantum-X800 能在两层 fat tree 拓扑中连接超过 10,000 个节点,每个节点拥有 800 Gb/s 带宽。这款 NVIDIA 交换机可从研究实验室扩展到超大规模 GPU 集群。

该交换机能应对未来更大规模的 AI 模型吗?

可以。800 Gb/s 的 InfiniBand 带宽可随你的需求扩展。这一 NVIDIA 平台支持超过 10,000 个节点,适配万亿参数模型。你的基础设施可以在不中断业务的情况下持续扩容。