NVIDIA 推出了 Quantum-X800 InfiniBand 交換器,這是 AI 基礎設施 領域的一項突破。這款高效能交換器提供 144 個 800 Gb/s 連接埠,專為連接現代 美國伺服器 部署中的大規模 GPU 叢集而設計。你可以消除 AI 訓練與推論中的資料瓶頸,從而加快模型開發速度,實現更大規模的部署。

800G InfiniBand 交換器代表了網路效能的一次飛躍。憑藉低於 100 奈秒的連接埠到連接埠延遲,以及透過 SHARP v4 所實現、達 14.4 TFLOPS(兆億次浮點運算)的網路內運算能力,Quantum-X800 平台樹立了全新的標準。800G InfiniBand 技術直接支撐日益成長的 GPU 運算需求。

這款交換器藉由為下一代資料中心提供骨幹網路,推動 AI 時代的演進。NVIDIA 的創新,使你能夠打造為未來 AI 工作負載做好準備的基礎設施。

重點速覽

  • 全新的 NVIDIA 交換器採用 800G InfiniBand,消除 AI 訓練中的資料瓶頸。
  • SHARP v4 技術從 GPU 中卸載部分工作,使訓練速度提升 9 倍。
  • 此交換器可連接超過 10,000 顆 GPU,並可在標準資料中心中運行,無需特殊散熱。
  • 它具備更低的功耗並支援未來的 AI 模型,讓你的基礎設施具備長期擴充能力。

為何 AI 需要 800G InfiniBand

AI 資料中心的瓶頸

AI 模型正以驚人的速度成長。自 2010 年以來,這些模型的參數數量大約每年翻倍。早期的模型(如 Theseus)只有 40 個參數,GPT-3 已達 1,750 億,而 QMoE 模型更是超過 1.6 兆。這樣的指數成長需要能跟上腳步的網路基礎設施。

在分散式訓練過程中,你的 GPU 叢集會面臨關鍵挑戰。梯度同步以及 All-Reduce、All-Gather 等集合通訊操作,可能耗費總訓練時間的 40–60%。這些操作對頻寬、延遲、抖動與壅塞控制極為敏感。即便是輕微的退化,也會造成 GPU 使用率大幅下滑。微秒級的抖動就可能讓分散式訓練效能降低 30% 甚至更多。

標準的 400G 乙太網路在這方面顯得力不從心。瓶頸不在名義速率,而在協定開銷。如果沒有 RDMA 支援,這類網路往往會有較高延遲、封包遺失與交換器壅塞等問題。每一項問題都會直接拖慢分散式訓練中的同步步驟,最後導致 GPU 空轉,等待遲遲未到的梯度與參數。

以 InfiniBand 將頻寬提升一倍

InfiniBand 從設計理念上便針對這些問題給出了答案。它提供分散式 AI 工作負載所需的超低延遲與無損通訊。採用 RoCEv2 的現代 400G 乙太網,在某些任務上可以與 InfiniBand 一較高下;Meta 使用 24,000 顆 GPU 訓練 Llama 3 即是典型案例。不過,對缺乏 RDMA 的標準乙太網而言,其先天不足是結構性的——10 GbE 比 InfiniBand NDR 慢上 40 倍。

800G InfiniBand 交換器將你的 AI 基礎設施可用頻寬提升了一倍。這項飛躍極具意義,因為集合通訊效能幾乎與網路容量成正比。更高的頻寬代表梯度能更快地在數千顆 GPU 之間交換,而更低的延遲則意味著處理器閒置時間更少。

長久以來,InfiniBand 一直是高效能運算(HPC)環境中的首選互連技術。其低延遲與高吞吐量,使其非常適合大規模平行處理。800G InfiniBand 技術將這項優勢延伸至 AI 時代。NVIDIA 針對大規模 AI 訓練工作負載,對此平台進行專門調校。

對 HPC 叢集與 AI 資料中心而言,選擇已相當明確:你需要的是能消除瓶頸,而非製造新瓶頸的互連技術。Quantum-X800 提供 144 個 800 Gb/s 連接埠,正是為此而生。這款交換器讓你的基礎設施為下一波 AI 創新做好準備。

NVIDIA 800G InfiniBand 交換器特性

無與倫比的吞吐量與連接埠密度

Quantum-X800 平台提供兩種不同機箱,以符合你的部署需求。Q3200-RA 採用 2U 機型,內建兩顆獨立的 28.8 Tb/s 交換晶片。此型號透過 36 個 OSFP 插槽提供 72 個 XDR 連接埠,總吞吐量最高可達 57.6 Tb/s。Q3400-RA 則採用 4U 機箱,透過 72 個 OSFP 插槽提供 144 個 XDR 連接埠,總吞吐量高達 115.2 Tb/s。兩款機型皆基於 Quantum-3 交換晶片,並搭載 Intel CFL i3-8100H 處理器。

你可依需求彈性設定連接埠速率:在 Q3200-RA 上,每個連接埠速率範圍自 40 Gb/s 至 800 Gb/s;Q3400-RA 則支援每連接埠 400 Gb/s 或 800 Gb/s。這項 800Gbps 網路能力將前一代產品的頻寬直接翻倍。800G InfiniBand 交換器技術讓端到端連線達到前所未有的速度。

對大規模 AI 叢集來說,連接埠密度同樣至關重要。Q3400-RA 與早期交換器相比,具備顯著優勢:

交換器型號連接埠數量連接埠速率
Q3400-RA144800 Gb/s
QM970064400 Gb/s
QM870040200 Gb/s

由此對比可見,其連接埠數量較 QM9700 提升 2.25 倍,較 QM8700 則提升 3.6 倍。Q3400-RA 的高 radix(高連接埠數)設計,讓你能打造兩層 fat tree 拓撲,將多達 10,368 張網路介面卡在最低延遲條件下互聯,為最嚴苛的工作負載提供最佳作業區域性。

Q3400-RA 亦採用風冷設計,可直接部署於現有資料中心中,無需進行大規模基礎設施改造。機箱配置 8 個可更換電源模組與 10 個可更換風扇,方便維護。兩款機型皆提供 USB 2.0 Type-A 連接埠、管理連接埠與主控台連接埠,便於日常營運管理。

搭載 SHARP v4 的先進網路內運算能力

800G InfiniBand 平台導入新一代網路內運算技術 SHARP v4。此協定透過將集合操作卸載到交換網路本身,加速相關運算流程,從而降低資料在網路中的往返,同時提升整體效率。

與前一代 SHARP 技術相比,SHARP v4 帶來 9 倍的網路內運算效能提升。這項改進直接縮短 AI 訓練週期。對於基於 NCCL 的工作負載,採用 SHARP 加速的集合通訊可帶來最高 2.5 倍的效能提升。由於梯度同步不再成為瓶頸,你的大型語言模型訓練速度因而大幅提升。

此交換器亦整合增強型自適應路由功能,可針對動態流量型態優化路徑選擇。以遙測為基礎的壅塞控制利用即時網路資料,在壅塞發生前便預先防範。這些能力通力合作,即便在高負載情況下仍能維持低於 100 奈秒的連接埠到連接埠延遲。

NVIDIA 也為 Quantum-X800 平台設計了優異的可靠性機制。自我修復的網路織構提供目前最快的復原機制,在鏈路故障時可達到 1,000 倍更高的彈性。即使個別連線出現問題,你的基礎設施依然能維持穩定運作。

超低延遲與高吞吐量的組合,使這款交換器非常適合高效能運算環境。HPC 叢集必須在成千上萬個節點之間維持一致的效能表現。Quantum-X800 平台可在兩層 fat tree 拓撲中支援超過 10,000 個節點,這一規模遠遠超出前一代產品所能承載的叢集大小。

對 AI 工作負載而言,收穫不僅止於速度。與早期型號相比,此交換器降低了每 bit 能耗。在維持卓越效能的同時,你能實現更高的每瓦運算能力。Quantum-X800 平台亦提供 Quantum-X Photonics 選項,將光學元件直接整合至交換晶片中,進一步降低功耗與延遲。

這款 800G InfiniBand 交換器為現代 AI 基礎設施提供一套完整解決方案。你將獲得推動尖端研究與生產系統所需的頻寬、智慧與可靠性。

800G InfiniBand 對 AI 的優勢

加速 AI 訓練與推論

Quantum-X800 InfiniBand 交換器在大型語言模型訓練效率方面實現 9 倍提升。這歸功於 NVIDIA 的 SHARP v4 協定,它在交換器上直接執行網路內資料彙總與集合操作。藉由將這些通訊任務從伺服器端卸載,交換器降低了通訊瓶頸與伺服器負載,從而大幅加快兆億參數模型的訓練週期。

你同時也能獲得顯著的能效改善。此交換器使用共封裝光學技術,取消了可插拔光模組。此一設計簡化了物料清單並降低成本,其能效較傳統可插拔光模組高出 5 倍。由於毋須 DSP 重定時器,網路側電力消耗大幅下降。這項降低直接減少 AI 資料中心的整體持有成本,隨著基礎設施生命週期推進,將累積成可觀的營運效益。

指標改善幅度
能效較可插拔光模組高出 5 倍
AI 應用持續運行時間韌性提升 5 倍
洞察時間(Time to insight)部署速度提升 1.3 倍

這三項指標凸顯 Quantum-X800 平台在營運層面的優勢。由於省去了 DSP 重定時器,此交換器也能進一步降低延遲。對大規模 AI 訓練而言,這種超低延遲至關重要,每一微秒都彌足珍貴。你的 GPU 將花更少時間等待資料,而能把更多時間投入運算。InfiniBand 架構提供標準乙太網難以達成的無損通訊,確保訓練作業不會因封包遺失或網路壅塞而被迫中斷。最終成果是:更快速的模型開發週期,以及整個叢集中更高的 GPU 使用率。

藉由 NVIDIA Quantum-X800 實現可擴充性

Quantum-X800 平台支援從小型研究實驗室到超大規模資料中心的平滑擴充。與前一代產品相比,NVIDIA 這款交換器在可擴充性方面展現出明顯優勢。

特性Quantum X800QM9700(前一代)
每台交換器連接埠數144(800 Gb/s)64(400 Gb/s)
最大主機連線數(兩層 Fat-Tree)>10,000(800 Gb/s)
網路內運算第四代 SHARP(支援 FP8)

高連接埠密度讓你得以在兩層 fat tree 拓撲中連接超過 10,000 個節點。如此規模足以承載最大型的 AI 工作負載,且無需構建複雜的多層網路設計。隨著運算需求增加,你的雲端基礎設施可以順暢擴張,每一個新節點都能在不打亂既有工作流程的情況下加入叢集。

Q3400-RA 採用風冷設計,可與現有資料中心的散熱基礎設施相容。

風冷平台僅支援具散熱鰭片(Finned Top)版本的 1.6T 收發器。平頂(Flat Top)版本仰賴冷板導熱,只適用於液冷架構。Q3400-RA 使用的是 Finned Top 收發器,這一點也證實了其風冷設計及與既有資料中心散熱系統的相容性。

得益於此風冷方案,你可以在標準機架中部署 Q3400-RA,而不必建置液冷系統。4U 機箱可直接放入既有資料中心機櫃中。你也因此無須為超大規模資料中心改造散熱系統,從而避免額外成本與複雜度。這項設計抉擇讓部署流程既簡單又可預期。

InfiniBand 技術與 NVIDIA 平台設計的結合,使這款交換器成為 HPC 環境的理想選擇。其超低延遲與高吞吐量足以支撐最嚴苛的 HPC 工作負載。你可以在同一張網路上同時執行 AI 訓練任務與傳統 HPC 模擬。隨著模型規模不斷膨脹,這款 InfiniBand 交換器亦能滿足持續成長的 GPU 運算需求。800 Gb/s 的連接埠頻寬確保 GPU 不會因資料不足而「餓死」。這種可擴充性讓你的基礎設施為未來 AI 突破預先鋪路。

NVIDIA Quantum-X800 平台象徵 AI 網路領域的一項關鍵進展。其 800G InfiniBand 技術為你的 AI 工作負載帶來前所未有的速度、更強的可擴充性以及更高的效率。這款 800G InfiniBand 交換器徹底消除了拖慢 GPU 訓練與推論的網路瓶頸。

NVIDIA 的技術藍圖也將這項創新持續推向新高。下一代平台 Quantum-X Photonics 將矽光子技術直接整合至交換器封裝,可實現 3.5 倍的能效提升與 10 倍更高的韌性。應用程式可在不中斷的情況下運行更長時間,最長可提升 5 倍。未來的 InfiniBand 連線將邁向 1.6T 速率,以支援兆級參數模型。

不妨思考這項技術將如何重塑你的資料中心策略。Quantum-X800 平台讓你的基礎設施如今便為明日的 AI 突破做好準備。

常見問題(FAQ)

Quantum-X800 與舊款交換器有何不同?

它提供 144 個連接埠,每個連接埠支援 800 Gb/s 的 InfiniBand 速率。這款 NVIDIA 交換器採用 SHARP v4 加速集合操作,讓大型 AI 模型的訓練效率提升 9 倍。

SHARP v4 如何提升 AI 訓練效率?

NVIDIA 的 SHARP v4 將集合通訊從 GPU 卸載到交換網路中。這項 NVIDIA 技術減少資料移動,在訓練工作負載中可帶來最高 9 倍的效能提升。

Quantum-X800 是否能在現有資料中心中使用?

可以。Q3400-RA 採用風冷設計,可直接部署在標準機架中,無須液冷系統。這讓它能輕鬆整合至超大規模資料中心與現有雲端基礎設施中。

這款交換器如何支援大型 AI 叢集?

Quantum-X800 能在兩層 fat tree 拓撲中連接超過 10,000 個節點,每個節點擁有 800 Gb/s 頻寬。這款 NVIDIA 交換器可從研究實驗室一路擴展至超大規模 GPU 叢集。

此交換器能應對未來更大規模的 AI 模型嗎?

可以。800 Gb/s 的 InfiniBand 頻寬可隨你的需求擴充。這項 NVIDIA 平台支援超過 10,000 個節點,足以因應兆級參數模型。你的基礎設施得以在不中斷業務的情況下持續擴容。