中國首個全國產十萬卡AI超集群曙光8000(登峰)在鄭州正式落成,并同步接入國家超算互聯網。這是國內首個從芯片到服務器再到交換機全部完成國產化的十萬卡集群。

十萬張AI加速卡同時運轉可以支撐當前中國5%~10%的Token訪問需求,或者在一天內完成過去數月才能跑完的模擬任務。然而,構建十萬卡集群并非簡單的堆算力,其工程難度、可靠性壓力和協同復雜度都會呈幾何倍數增長。中科曙光高級副總裁李斌表示,萬卡到十萬卡的升級不存在十倍疊加的線性邏輯,任何一個部件或鏈路的微小漏洞都可能導致整個集群性能坍塌。
為了解決這些問題,曙光8000采用“原生超智融合”架構,在同一套系統內同時支持從FP64到INT8的全精度計算。這要求網絡不僅要承載海量數據傳輸,還要在不同精度任務之間靈活切換。為此,曙光自研了scaleFabric高速互連網絡,采用類InfiniBand的原生RDMA技術,具備毫秒級鏈路故障恢復能力。此外,為了提高可靠性,曙光在柜級單元內優先使用銅互聯而非光互聯,因為銅的信號質量更好、故障率更低。
在芯片層面,雖然國產芯片單點能力與全球頂尖水平尚有差距,但可以通過更多芯片和更優的系統效率來彌補。曙光8000的意義在于證明中國有能力將超大規模算力組織起來并穩定運行,為下一階段的AI應用競爭提供了入場券。
此次落地的AI超集群在同一套系統內同時支持高精度科學計算和低精度AI訓練,即超智融合。傳統做法中,科學計算和AI訓練是兩套獨立系統,數據和任務需要來回搬運。曙光8000通過實現全類型計算的原生一體化融合,解決了這一問題。這種通用性帶來的好處是顯而易見的,例如在藥物研發中,科學計算和大模型訓練可以在同一套系統內完成,無需跨系統調度數據,大大提高了效率。




