在生成式大模型訓練中,服務器之間需要頻繁地進行大量數據的傳輸和交換。傳統的傳輸控制協議/互聯網協議(TCP/IP) 在數據傳輸的過程中需要在用戶空間與內核空間之間多次拷貝,降低了數據傳輸效率。相比之下,RDMA允許應用程序直接訪問遠程節點的內存,不經過內核,具有高吞吐、低延遲、無CPU占用等優點,可提升模型訓練效率,更為適合生成式大模型訓練。英偉達Quantum-2 Infiniband平臺技術A&Q
一顆Jericho3-AI芯片,用來替代InfiniBand?
3、配置 InfiniBand 和 RDMA 網絡.pdf?6、面向分布式 AI智能網卡低延遲Fabric技術.pdf7、NVMe存儲SPDK 加速前后端 IO.pdf8、基于RDMA多播機制的分布式持久性內存文件系統.pdfRDMA 主要包括 3 種類型協議:InfiniBand (簡稱IB)、基于以太網的 RDMA(RoCE)以及基于TCP/IP協議棧的RDMA(iWARP)。3種協議都符合 RDMA 標準,使用相同的上層接口,具體如圖所示。IB 從鏈路層到傳輸層定義了一套全新的層次架構,是為高性能計算設計的專用技術。IB 在部署時需要專用設備,如 IB 專用交換機、IB 專用網卡、IB專用線纜等,無法與現有的以太網設備兼容。相比于傳統以太網,IB具備高帶寬、低延遲的數據傳輸能力以及無損網絡的特征,可滿足大型數據中心和超級計算中心對高性能網絡的需求。但是,IB 體系獨立封閉,采購維護成本高昂,現階段主要被用于高性能計算領域,如超級計算機、數據中心和科學研究機構等。現網中部署著大量基于以太網的產品。為了擴大RDMA的應用范圍,IB行業協會 (IBTA) 組織定義了基于以太網(Ethernet) 的RoCE技術標準,允許在不依賴IB專用硬件的情況下使用RDMA。RoCE通過擴展以太網協議棧,使標準以太網設備支持RDMA操作,實現了高性能遠程內存訪問與以太網易用性和廣泛部署特點的結合。現階段RoCE有兩個主要版本:Ro‐CEv1和RoCEv2。RoCE v1發布于2010年,是基于以太網鏈路層實現的RDMA協議,但由于它不支持路由,也沒有擁塞控制機制,難以在數據中心規模使用。RoCEv2 版本是對RoCEv1版本的重大改進,它基于以太網的用戶數據報協議(UDP)。RoCEv2支持路由,并且定義了基于顯式擁塞通知(ECN)/擁塞通知報文 (CNP) 的擁塞控制機制。相同場景下,RoCE雖然較IB性能有所降低,但是因其性價比更高,目前已經在一些超大規模數據中心商用部署。iWARP 是國際互聯網工程任務組 (IETF) 提出的基于TCP的RDMA協議。由于TCP是面向連接的可靠協議,這使得iWARP在面對有損網絡場景時相比于RoCEv2和IB具有更好的可靠性。但是大量的TCP連接會耗費很多的內存資源,另外TCP復雜的流控等機制會導致性能問題,限制了其應用范圍,現階段并未大規模使用。綜上所述,IB 在高性能計算領域表現出色,可提供卓越的性能、低延遲和可擴展性,目前在高性能計算領域占據較大優勢。相比之下,RoCE則更容易集成到現有以太網基礎設施中,并具有較低的成本,是現階段大模型訓練網絡的主流方案。2023 年,由眾多云計算和網絡科技巨頭組成超以太聯盟,針對IB的封閉生態和原有RoCE的不足,提出了下一代人 工 智 能 (AI) 和 HPC 網 絡 的 協 議:超 級 以 太 網 傳 輸(UET。基于 IP 和以太網進行設計,在基于多路徑和數據包噴灑負載均衡、Incast管理機制、高效的速率控制算法、允許亂序數據包傳遞的應用程序編程接口 (API) 等方向進行了創新,以減少針對特定網絡和負載對擁塞算法的復雜參數調優,支持百萬節點的大規模網絡擴展。RDMA 的大規模組網通常采用基于 Fat-Tree 的 Clos 架構。基于Fat-Tree的Clos架構的基本理念是使用大量的商用交換機,在服務器之間構造出多個等價路徑,交換機對流進行ECMP實現負載均衡,進而形成大規模的無阻塞網絡。與傳統數據中心的流量分布不同,大模型訓練網絡中多為大象流,數量相對較少。這使得傳統的ECMP存在哈希極化現象,即多個流可能分配到同個鏈路上,負載不均造成流沖突。同時,由于ECMP還是一個無狀態的局部決策,不關心不同流的大小差異,在流數目不多且大小流長尾嚴重時,容易造成多條路徑中某些路徑擁塞而另一些路徑空閑,從而造成帶寬浪費和影響傳輸效率。因此,負載均衡是大規模AI集群網絡面臨的又一挑戰。針對ECMP存在問題,有以下兩種負載均衡優化方案:第1種方案是改變流的屬性,把流分散到多個等價路徑上。在交換機ECMP不變的情況下,改變流的標簽,或增加流的熵(將流分割成更小的流或基于報文頭的其他位置字段做哈希),讓流變得更多從而能通過哈希散開。代表性方法有PLB,在主機端利用擁塞探測感知擁塞的流,對擁塞流的流標簽進行更改,引導交換機對流進行重新等價多路徑ECMP/加權多路徑 (WCMP) 哈希,從而為擁塞流選擇新路徑。第2種方案是基于網絡狀態的流量調優。通過實時收集網絡拓撲和流量等信息,由集中軟件定義網絡(SDN)控制器為每條流計算出最優路徑,或由交換機進行自適應路由選擇,包括集中式流量工程、自適應路由技術和網絡級負載均衡技術等。1) 集中式流量工程:SDN控制器實時收集網絡拓撲和任務放置信息,基于約束最短路徑算法為各個流計算最優路徑。2) 網絡級負載均衡技術:根據大模型訓練的流量特征,綜合網絡拓撲等整網信息,計算出最優的流量轉發路徑。3) 自適應路由技術:交換機根據出口隊列負載評估擁塞情況,為每個數據包選擇最不擁塞的端口進行數據傳輸,以實現負載均衡。由于同一流的不同數據包可能由不同網絡路徑傳輸,到達目的節點時可能出現亂序,因此需要網卡側在RoCE傳輸層完成對無序數據的轉換,再將有序數據傳遞給應用程序。此外,目前一些研究也指出:原生RoCE協議中規定數據包順序到達的設計弊端是制約負載均衡的關鍵因素。未來應從根本上改進傳輸協議,采用數據包噴灑等技術,使得數據包可以通過多路徑順序傳輸,然后再利用可編程交換機或智能網卡重新對數據包排序,以充分利用網絡的多個可用路徑實現負載均衡。2024年中國AI大模型場景探索及產業應用調研報告:大模型“引爆”行業新一輪變革3D DRAM行業報告:3D DRAM時代或將到來,國產DRAM有望迎來變革契機光芯片研究報告:高速互聯需求驅動光通信行業發展,國產光芯片有望加速滲透1、艾媒咨詢:2024年中國信創產業發展白皮書(精簡版)
2、艾媒咨詢:2023年中國信創產業發展白皮書(精簡版)1、2024大模型典型示范應用案例集
2、2023大模型落地應用案例集2024亞太不同國家和區域對生成式AI的反應白皮書計算機自主可控系列:國產AI算力萬卡集群,多芯混合時代來臨計算機行業深度:從技術路徑,縱觀國產大模型逆襲之路
本號資料全部上傳至知識星球,更多內容請登錄智能計算芯知識(知識星球)星球下載全部資料。

免責申明:本號聚焦相關技術分享,內容觀點不代表本號立場,可追溯內容均注明來源,發布文章若存在版權等問題,請留言聯系刪除,謝謝。
溫馨提示:
請搜索“AI_Architect”或“掃碼”關注公眾號實時掌握深度技術分享,點擊“閱讀原文”獲取更多原創技術干貨。

