AI算力競賽新階段!光纖佈線成新難題 BiDi技術化繁為簡有望解套

記者許若茵/台北報導

隨著AI模型規模與運算需求持續攀升,AI基礎架構面臨的挑戰,正從單純增加更多GPU,進一步轉向如何以更高效率連接大規模運算資源。Lightmatter解決方案架構師Taylor Groves與產品行銷經理Lars Johnsson指出,更大的縱向擴展(scale-up)領域可直接支援更快的訓練速度與更佳的模型品質,使高頻寬、低延遲互連日益成為下一世代AI基礎架構的關鍵。然而,當銅纜逐漸觸及物理極限、scale-up網路轉向光學互連時,快速增加的光纖數量與佈線複雜度,也帶來成本、部署、供應與可靠性等新的挑戰。

藍光光纖穿梭 AI 伺服器叢集
當銅纜逐漸觸及物理極限、scale-up網路轉向光學互連時,快速增加的光纖數量與佈線複雜度,也帶來成本、部署、供應與可靠性等新的挑戰。(圖/AI生成)

Lightmatter指出,雙向(BiDi)光學技術提供了一條更具效率的發展路徑。BiDi利用不同波長,在單一光纖上分別承載傳送與接收訊號,可降低大型scale-up網路所需的光纖與連接器數量,同時維持交換器 radix(連接埠數)、頻寬與鏈路傳輸距離不變,其價值不只是減少光纖用量,更在於簡化支撐日益龐大AI叢集所需的實體基礎架構。

Lightmatter說明,Scale-up領域是由AI加速器緊密耦合而成的叢集,在邏輯上如同單一GPU運作,其規模直接決定訓練吞吐量、推論延遲與 token生成速率。在每通道200 Gb/s的速率下,銅纜傳輸距離約僅一公尺,使scale-up叢集受限於一至兩個機架,也就是72至144顆 GPU。若要跨機架連接512顆以上的加速器,光子互連是唯一可行的發展路徑。然而,光纖佈線數量增加、複雜度提高與供應短缺,也會顯著增加上市時程、成本與可靠性方面的風險。

根據Lightmatter的512-GPU scale-up模型,且結果與其他獨立分析一致,分析顯示BiDi 可將光纖與連接器數量減半,並將scale-up網路總支出降低約15%,還能將被動光路中的潛在故障點減少約一半,同時維持交換器radix(連接埠數)、頻寬與鏈路傳輸距離不變。Lightmatter已在其互連產品組合中導入 BiDi。

打造更大型AI模型的競賽,如今也與擴大scale-up領域規模的競賽緊密相連。Lightmatter提到,在晶片與封裝層級,GPU受到矽晶片面積、良率與功耗限制,因此產業的因應方式,是將數百顆加速器整合成單一高頻寬、低延遲的機櫃組(pod),讓AI模型將其視為一顆超大型 GPU。更大的 scale-up領域可直接支援更多可部署的專家、更快的訓練速度,以及更佳的模型品質。

Lightmatter說明,Pod無法透過銅纜持續擴展。在目前每通道200G的 SerDes速率下,被動式電氣互連的最大傳輸距離約為一公尺,實際上將以電氣方式連接的scale-up領域限制在一至兩個機架內,光纖跨越 pod 內機架之間數十公尺的距離時,額外損耗可忽略不計,因此勢必成為替代方案。然而,單純以光鏈路取代銅纜,也會帶來新的挑戰。

對單一512-GPU pod而言,UniDi光學網路會形成龐大的光纖佈線:數十萬芯光纖、數萬個連接器,以及用來重新排列光纖路徑的 shuffle box;每一芯光纖與每一個對接連接器,都可能成為污染、錯接或故障的風險點。

Lightmatter認為,既然scale-up勢必走向光學互連,關鍵問題就在於如何因應佈線複雜度增加所帶來的光纖成本與故障風險,最直接且有效的答案,就是雙向光學技術。

 

Loading

發佈留言

Back to top button