City

為什麼 AI 正在放慢腳步——而且這不是算力問題



AI 瓶頸:運算大幅超越 連接 


現代 AI 模型,例如 ChatGPT 或 Gemini,已經龐大到無法放入單一 GPU 的記憶體中。要 訓練或 執行這些模型,我們必須將它們拆分,把工作負載分散到數千顆 GPU 之間,或是在 AI 資料 中心內進行。 


這使 AI 變成一個 網路問題。這成千上萬顆晶片必須像一個單一 "超級大腦。" 若它們之間的連線 效能受損,整台超級電腦就會變慢。 

 





考量 AI 資料中心的使用情境:

 


 

訓練:我們需要一顆 強大的 大腦 

訓練大型 AI 模型,其核心其實是一項記憶體共享的挑戰。資料集和模型權重都太大,無法放進單一晶片的記憶體(VRAM)中,所以我們必須把數千顆 GPU 的記憶體整合成一個大型共享資源。

為了讓資料在這些 GPU 之間即時傳輸,我們需要超高頻寬的連線。但問題來了——機架前面板上的實體空間真的快被用光了,根本沒有足夠的地方插上實現這一切所需的所有線纜。若連線速度不夠快,GPU 就無法及時取得所需資料,訓練也就會停擺。

推論:關鍵在於 高效率分配 工作負載 

 










模型一旦訓練完成,重點就轉向成本效率。執行這些模型的成本極高,因此目標是讓每一顆 GPU 的使用率最大化。你希望處理器 100% 的時間都在工作,而不是等待資料。

工作負載需要以近乎零延遲的方式在晶片之間動態分配。互連中即使只有奈秒級的延遲,也可能讓昂貴的處理器閒置。這段“空轉時間”只會耗電卻不產生價值,最終提高每次查詢的成本。

 



為什麼 不使用更便宜的銅纜方案? 






雖然銅纜在短距離上表現良好,但在下一代速度下會碰到物理極限  


  1. 距離限制: 隨著速度提升,銅纜中的訊號會迅速衰減。 在高速下,有效距離可能被限制在 2 公尺以下。 這會把你的 AI 叢集限制在單一機櫃內。 若要擴展到機櫃之外, 就必須使用訊號補償 IC。 


  1. 笨重問題: 為了承載高速訊號,銅纜必須做得又粗又有屏蔽。 連接數千條 DAC 並不容易處理, 也會形成一道阻擋氣流的實體牆,導致伺服器過熱。

    1-3