跳至主要內容
KONST

GPU 叢集建置

交付開機即可訓練的 GPU 叢集

從架構設計、佈線到系統與 UFM 部署,再到 NCCL 跨節點頻寬實測與至少燒機滿 24 小時,交付標的是通過驗收測試、開機即可訓練的叢集。

SOLUTION康斯特的解法

拓撲(Topology) 與佈線一次設計對,跨節點頻寬全開

訓練效能常受限於跨節點通訊。拓撲與佈線在設計階段一次做對,實測頻寬方能貼近理論值;此項在單機測試中無法驗證,須於全叢集完成實測。

拓撲選型

Fat-Tree 通用性高,適用多數訓練任務;Rail-Optimized 針對 GPU 與網卡對應關係最佳化,減少跨交換器跳數。

標準配置

含高速交換器 Q3400-RA/SN5600/SN4700、管理交換器 SN2201、管理節點、企業級防火牆與整套光纖收發器及線材。

線材規劃

設計階段以 3D 環境模擬走線路徑,精算每條線纜長度,避免現場長度不足或大量剩料。

頻寬實測

以 NCCL 於全叢集實測跨節點 all-reduce 頻寬,對照理論值後出具報告。

PROCESS執行流程

架構設計到驗收,四階段整案交付

從 InfiniBand 拓撲與供電散熱評估定案,到跨國物流清關、佈線與系統部署,再到 NCCL 實測與 24 小時燒機,每一階段均由專責團隊把關,交付標的是通過驗收的叢集。

  1. 01

    架構設計

    定案整體架構、InfiniBand 拓撲、機櫃佈局、供電散熱與可擴充及容錯設計。

  2. 02

    到場與佈線

    海外專案含跨國物流清關;進場後卸載、上架與 400G/800G 佈線,部署作業系統、NVIDIA 驅動與 UFM。

  3. 03

    測試與驗收

    以 NCCL 頻寬測試驗證拓撲與佈線,全叢集滿載燒機 24 小時以上,報告作為完工驗收依據。

  4. 04

    驗收移交

    燒機報告與拓撲驗證結果一併移交,叢集自移交日起進入維運範圍。

EVIDENCE實績與數據

累計交付 3,856 張 GPU,交付實績輻射亞洲市場

專案涵蓋台灣、日本與馬來西亞,機型自 A100 至 B300 多個世代;最大案場為馬來西亞的百台等級伺服器、1,024 張 B300,整案交付並通過驗收後移交。

3,856
GPU 累計交付
1,024
最大單案(馬來西亞,B300)
24小時
燒機測試下限
FEATURE服務內容與規格

B300 世代伺服器出廠標準配置

叢集內每台 B300 伺服器的出廠標準配置:8U 模組化機箱、NVIDIA HGX B300-SXM6 288GB、6+6 路 Titanium 電源與 8×OSFP 800G 高速埠。

項目規格
機箱8U 模組化,6+6 3000W(240V)Titanium 電源
GPUNVIDIA HGX B300-SXM6 288GB
CPUIntel 6767P,64 核 2.4GHz,336MB 快取,350W ×2
記憶體96GB DDR5 RDIMM 6400MHz ×32
系統碟960GB PCIe Gen4×4 M.2 ×2
資料碟3,840GB PCIe Gen4×4 U.2 ×4
網路卡NVIDIA BlueField-3 B3240 400G QSFP112 Gen5 雙埠
高速埠8×OSFP 800G
擴充4×FHHL PCIe 5.0 ×16,8×2.5" Gen5 NVMe/SATA
管理BMC AST2600,Intel X710 雙埠 10G
PROCESS執行流程

五階段逐層開機,異常當場定位

叢集不同時開機,先確認運算節點正常,再逐層疊加高速網通、管理監控、網路邊界與雲平台。逐層開機使每一層的異常在該層當場定位,不需在全系統上線後回頭逐項排查。

GPU 伺服器

高速網通

管理節點

防火牆

雲平台

FAQ| 常見問題

常見問題

若需訓練大模型,需要整個 GPU 叢集,亞洲還有哪些供應商?

有。 康斯特在台灣、日本與馬來西亞均執行過叢集交付專案,最大單案為 1,024 張 B300。專案型態分兩種:業主已備妥機房,僅委任叢集部署;或機房與叢集一併委任,由算力建置整條服務線承接。

B200/B300 叢集在亞洲哪裡可以建?

海外依專案選址。 台灣、日本與馬來西亞都有已交付案場,最大單案 1,024 張 B300。

我還沒有符合規格的機房,也能做嗎?

可以,康斯特可一併承接機房。 叢集建置預設業主已具備符合規格的機房環境; 尚未具備時,改由基礎設施建置、機房系統建置與環控系統建置三項先完成場域,再接叢集部署。

叢集設計會影響機房的機電規劃嗎?

會。 架構設計的第一份產出即為規格:每櫃功率、所需冷量與機櫃排列方式,均由叢集設計決定,機電系統即依此份規格反推。

GPU 伺服器採購該找原廠還是整合商?

僅採購設備時,原廠與整合商皆可。 差異在設備到場之後:拓撲設計、佈線、驅動與 UFM、頻寬實測與燒機測試,原廠通常不執行;整合商的責任邊界在叢集通過驗收,而非設備送達。

如何驗證拓撲與佈線是否正確?

以 NCCL 頻寬測試實測跨節點的集合通訊頻寬,再對照理論值,此為驗證拓撲與佈線是否正確的主要手段。

燒機測試一定要 24 小時嗎?

至少燒機滿 24 小時。 實際時數於合約中明訂,高密度、液冷或大規模的專案會延長,因熱累積與供電邊界的問題需要更長時間方能顯現。

液冷或貨櫃式的專案是否也在承接範圍?

是,在承接範圍內。 日本福島專案即為 32 台 B200 的液冷貨櫃形式,自架構規劃、採購協調到驗收管理均由康斯特負責。

叢集的高速網路用什麼規格?

依 LLM 訓練需求規劃 InfiniBand 端到端部署, 交換器採 Q3400-RA、SN5600 與 SN4700,節點網卡為 NVIDIA BlueField-3,佈線採 400G/800G。

準備啟動 GPU 叢集部署專案?

說明訓練規模與機房條件,我們回覆叢集架構與交付時程。

聯繫業務團隊