如何診斷並優化網路壅

少量異常工作負載就可能在多節點 GPU 叢集中造成尾延遲。這種延遲會拖慢分散式操作中的作業完成時間。事實上,網路壅塞會迫使 GPU 在同步步驟期間處於閒置狀態。
你必須部署具備高解析度流量遙測、拓撲感知與傳輸協定調校能力的高效能 AI 架構,才能解決微突發與 PFC 暫停風暴問題。
有針對性的後端網路優化能夠恢復整個叢集的高吞吐。主動式 AI 網路策略可消除現代網路 Fabric 中的流量瓶頸。先進的 AI 網路仰賴持續的 Fabric 監控來防止緩衝區耗盡。妥善的網路設計能夠確保在高強度 AI 模型訓練過程中維持較高的算力利用率。
識別 Fabric 中網路壅塞的成因
高效能 AI 網路要求對所有交換節點進行持續的流量監控。在分散式訓練過程中,同步式集合通訊操作會給叢集 Fabric 帶來巨大壓力。
微突發、Incast 與 PFC 暫停風暴
同步式集合通訊操作會在後端 Fabric 中引發突發流量。在一次本地 AllToAll 操作中,多個工作節點會同時向同一個接收節點傳送資料。這種 Incast 模式會導致緩衝區急劇堆積,並帶來嚴重封包遺失。
當緩衝佇列被填滿時,接收端交換器會向上游傳送優先級流量控制(PFC)暫停幀,以防止丟包。這種反壓會使網路中該優先級佇列上的所有流量全部暫停。
- 上游交換器會在特定優先級佇列上接收到 PFC 暫停訊號。
- 交換器會暫停整個佇列,使壅塞流與未壅塞的受害流同時停止。
- 這種反壓會跨越多個跳點傳播,造成隊首阻塞與嚴重的速率振盪。
不穩定的暫停幀傳播會在 Fabric 中形成壅塞樹。這一過程會增加尾延遲,並降低整個叢集的總體吞吐量。
CLOS 與 RAIL 架構中的拓撲瓶頸
網路架構決策會直接影響你的 Fabric 在面對高強度 AI 工作負載時的承載能力。傳統 CLOS 網路依賴等價多路徑路由來分散動態流量需求。
然而,標準 CLOS 設計在 all-reduce 操作期間,往往難以應對靜態流綁定與負載失衡問題。
| 網路設計 | 核心流量假設 | 主要網路限制 |
|---|---|---|
| CLOS 架構 | 假設流量由彼此獨立、生命週期較短的微服務流組成 | 標準 ECMP 路由會導致流碰撞 |
| RAIL 最佳化架構 | 專為同步、長持續時間的大象流而設計 | 超額訂閱比會造成瓶頸 |
GPU 叢集中的次佳作業放置還會進一步惡化整體網路效能。糟糕的排程器決策會觸發局部葉交換器瓶頸,從而增加總作業完成時間。
面向 AI 模型訓練的遙測策略
現代叢集架構需要高解析度流量遙測,才能觀測後端 Fabric 的效能。你必須監控即時網路狀態,才能維持可靠的 AI 網路環境。
即時遙測與帶內流量監控
在 AI 模型訓練過程中,你需要對交換器緩衝區與資料封包標記進行精確視覺化。高效能交換硬體藉助硬體加速處理,在後端 Fabric 中串流傳輸即時資料。先進的收集器網路會追蹤系統訊號,以維持 Fabric 健康狀態。
| KPI 名稱 | 說明與維運意義 |
|---|---|
| ECN 標記比率 | 用於衡量被標記 CE 碼點的資料封包比例,以檢測持續性壅塞。 |
| PFC 事件速率 | 用於追蹤流控暫停訊號,防止交換器佇列溢位。 |
| 緩衝區占用率(P99) | 用於擷取 99 分位佇列利用率,以揭示極端記憶體飽和情況。 |
| 重傳率 | 用於識別硬體鏈路上的丟包情況,從而定位傳輸退化問題。 |
你必須追蹤關鍵硬體計數器,盡早發現效能下降。應始終優先關注 Adp Retx 與 PCI 計數器,以定位常見瓶頸。標準網路框架會在邊緣端部署自適應取樣與壓縮。這項技術可在保持完整精度的同時,將遙測資料總量最多減少 80%。
高解析度收集器會擷取維運資料,以改進整體網路設計。分散式收集器會分析流量流向,保護後端網路穩定性。你應評估活躍交換器上的延遲指標,以測量路徑時延。追蹤延遲指標能為持續最佳化提供清晰的維運回饋。高吞吐要求每一條 Fabric 路徑都具備低延遲。
面向壅塞的時序異常檢測
主動式遙測系統可在緩衝佇列溢位前防止網路壅塞。你可以部署 LSTM 與 1D-CNN 等深度學習時序模型來處理連續的指標流。Autoformer、Informer 與 TimesNet 等先進 Transformer 架構可在動態訓練階段預測流量趨勢。現代維運體系還會利用 MOMENT 這類通用時序基礎模型來檢測細微的運行異常。
一個基於 18 個月排程歷史訓練而成的時序模式引擎,可在需求高峰真正出現前 2 到 8 分鐘預測算力需求,並預先放置張量分片。
這種預測性操作可消除大型叢集中的算力閒置,因為這些叢集每週會因被動排程延遲而損失數千 GPU 小時。該遙測框架以 100 毫秒間隔持續採集資料。
- 每 100 毫秒採集一次 GPU 溫度、記憶體壓力、NVLink 利用率與作業佇列深度。
- 使用 Prometheus 的
rate()函式來計算重傳率,而不是直接使用原始計數器值。 - 將重傳峰值與 NCCL 效能指標直接關聯,以確認是否存在丟包。
- 為高往返時延、TLP 錯誤與鏈路退化設定關鍵警示。
主動預測能夠在重度集合通訊期間維持高效的 AI 網路標準。智慧異常檢測可將後端網路轉化為具備韌性的 Fabric。妥善的資料攝取能夠強化大型算力叢集中的穩健網路維運。智慧遙測策略透過保護活躍作業免受緩衝區耗盡影響,增強企業級 AI 網路架構。細緻的監控可在高負載下保障穩定的網路效能。
針對 AI 訓練工作負載最佳化 Fabric
你可以透過校準傳輸協定並最佳化後端基礎設施中的作業排程來消除 Fabric 瓶頸。明智的工程決策會直接提升大規模叢集運行期間的網路效能。
傳輸協定與 DCQCN 參數調校
資料中心量化壅塞通知(DCQCN)用於控制 RoCEv2 網路中的壅塞。在高強度操作期間,你必須調整 DCQCN 參數,以在系統吞吐與資料封包時延之間取得平衡。當佇列深度超過閾值限制時,交換硬體會使用明確壅塞通知(ECN)對資料封包進行標記。
- 根據鏈路頻寬與埠佇列容量設定
min_kt與max_kt緩衝閾值。 - 設定目標速率下降參數
ai,以防止在微突發期間發生嚴重流量限速。 - 調整計時器參數
hai,以便在壅塞解除後快速恢復目標頻寬。
錯誤的參數值會在高效能 AI Fabric 中引發速率振盪。精細調校協定設定能夠為同步式 GPU 通訊建立可靠的 AI 網路。妥當的參數選擇可以在高流量突發下穩定核心網路基礎設施。最佳化後的傳輸控制可降低叢集中每個節點的尾延遲。現代高效能網路可確保複雜集合通訊步驟中的平順傳輸。
自適應路由與作業放置最佳化
靜態 ECMP 路由會在 all-to-all 通訊期間造成資料封包碰撞。自適應路由硬體會動態評估鏈路利用率。交換器會將資料封包灑送到可用路徑上,以維持最佳 Fabric 流動。這種動態分配能夠提升多層拓撲中的整體網路效率。
拓撲感知作業排程可透過將相關計算任務集中放置,避免鏈路飽和。妥善的放置策略可保護你的後端網路環境免受局部壅塞影響。一項定量模擬研究評估了不同放置策略的維運收益。
| 改進面向 | 定量模擬研究中的證據 | 量化支撐 |
|---|---|---|
| 提升網路利用率 / 減少碎片化 | 研究顯示,排程器能夠有策略地將小型作業放置在 NVLink 網域中的特定節點上。 | 熱力圖顯示,小作業被集中放置在每個網域最後兩個節點上,以盡量減少高頻寬網路資源碎片化,從而為更大作業保留資源。 |
| 將效能開銷降至最低 | 研究將這種拓撲感知排程器的占用率(可視為利用率代理指標)與理論上的最優、但不具備拓撲感知能力的排程器進行比較。 | 結果表明,占用率差距僅約為 1%(圖 5),證明即使避免了糟糕放置帶來的效能損失,依然能夠維持很高的利用率。 |
| 支撐研究的規模 | 相關證據基於一個細粒度、時間加速的 Slurm 模擬框架。 | 該模擬對一個 5,000 節點叢集進行建模,在 7 天時間內回放了 15,000 個作業,因此具備統計意義上的顯著性與量化價值。 |
智慧放置演算法可以隔離高強度工作負載,使計算核心保持充分活躍。當排程器能讓作業需求與實體鏈路容量相匹配時,整體 AI 工作負載執行會更快。每一種現代 AI 工作負載都需要精確放置,以最大化硬體回報。高效的作業分配能夠強化現代分散式環境中的穩健 AI 網路。先進排程可以保護企業級 AI 網路部署,避免突發通訊降速。透過將通訊模式與交換連線關係相匹配,你可以保留更多 Fabric 容量。明智的排程決策能夠增強企業資料中心中的現代 AI 網路維運。透過將自適應路由與拓撲感知排程結合應用於所有 AI 訓練工作負載,你可以實現穩定的叢集吞吐。有效的 Fabric 調校可使基礎設施更適配高強度 AI 訓練工作負載。
透過將持續遙測、自適應路由與經過調校的傳輸參數整合進一個主動回饋閉環,你可以最大化 GPU 算力利用率。主動式壅塞管理與拓撲感知作業放置能夠消除網路壅塞。這一策略可提升後端叢集的整體訓練效率。現代 AI 網路透過平衡流量需求,在高強度操作期間維持高網路效能並盡可能降低時延。
網路架構師必須定期完成三項 Fabric 稽核:
- 檢查交換器緩衝閾值,防止丟包。
- 校準 ECN 標記速率,控制佇列成長。
- 更新路由參數,提升網路效率。
高效的 AI 網路能夠建立具備韌性的後端 Fabric。智慧網路實務可保護後端節點免受嚴重瓶頸影響。妥善的網路設計能夠最大化叢集產出。
常見問題
在 AI 模型訓練期間,是什麼導致了 PFC 暫停風暴?
同步式集合通訊操作會產生流量微突發與嚴重的 Incast。當交換器佇列被填滿時,接收端交換器會向上游傳送 PFC 暫停幀。這些暫停訊號會跨越多個跳點傳播,在你的後端 Fabric 中造成反壓、隊首阻塞與暫停風暴。
明確壅塞通知如何緩解 Fabric 壅塞?
當交換器佇列深度超過你設定的閾值時,明確壅塞通知會對資料封包標頭進行標記。該訊號能夠及早通知端主機存在持續性壅塞。因此,端主機傳輸協定會在丟包發生與緩衝佇列溢位之前先行降低傳送速率。
為什麼在後端網路中應優先選擇自適應路由,而不是靜態 ECMP?
靜態 ECMP 會沿固定路徑轉送流量,在同步式大象流場景下引發流碰撞。自適應路由則會動態評估即時鏈路利用率。交換器會將資料封包灑送到所有可用的運行路徑上,從而最大化整體網路吞吐,並防止局部頻寬瓶頸。
拓撲感知作業放置如何提升叢集效率?
拓撲感知排程器會將相互關聯的 GPU 任務分配到共享 NVLink 網域內彼此鄰近的實體節點上。這種智慧放置方式能夠隔離高通訊強度流量,減少多層拓撲中的鏈路碎片化,並防止共享葉節點鏈路上的頻寬飽和。
