上線後缺乏專責維運人力
監控、告警與 RMA 沒有專責窗口,只能由既有 IT 人員兼辦。
算力機房維運服務
承接資料中心與 GPU 叢集上線後的日常維運:主動監控告警、故障判讀、原廠 RMA 協調、UFM 叢集網路維持與緊急到場。斷電斷網一小時回應,設備報修四小時,每月產出維運報告。自建與他廠建置的案場皆可委任。
所有權轉移不等於有人接手日常:告警要專人值守,硬體故障要有人開 RMA 追到料,叢集網路要有人隔離故障節點,這些都在上線後才展開。
監控、告警與 RMA 沒有專責窗口,只能由既有 IT 人員兼辦。
GPU 叢集網路與一般機房網路差異大,缺乏經驗時難以即時定位異常。
保固條款寫在合約裡,但現場拆換、送修與復機仍需人到場執行。
沒有約定回應與到場時限,異常發生時只能被動等待。
值班人員即時監看告警並當場判讀分類,多數事件於遠端完成排除,回應時間最短。確認硬體故障後開立 RMA,追蹤至料件到位與更換完成;需現場作業的事件即刻派工到場,按次計費,依平日假日與時段分級。
設備狀態與告警由值班人員 24/7 即時監看,於遠端完成判讀、分類與第一線排除。
確認硬體故障後向原廠開立 RMA,全程追蹤至料件到位與更換完成。
持續監控高速網路狀態,偵測鏈路異常並隔離故障節點。
Day-2 遠端維運均運行於此平台,產出儀表板與報表,資安更新依排程執行。
需現場作業的事件由工程師到場處置,按次計費,依平日假日與時間內外分級。
業主技術人員可納入教育訓練,接手一線判讀與例行檢查。
設備與場域由同一方負責時,採可用率保證模式,以整體可用率為承諾標的,並約定未達標的服務費調整機制;責任橫跨多方時,採回應時效保證模式,承諾告警回應與故障處置的時限。可用率同受電力、機電與設備品質影響,模式與責任邊界於簽約前一併確認。
以整體可用率為承諾標的,未達標時的服務費調整比例與上限於合約載明。
承諾告警回應與故障處置的時限,可用率依實際場域條件另行評估。
維運費的邊界於簽約時一次寫定:哪些日常維護含在月費,哪些屬料件與工程須另行計價,以及驅動與框架升級後的相容性問題。
月費涵蓋日常維運的人力與作業,不因事件次數另行計價。
屬料件成本、新增工程或業主端環境的項目,依實際項目另行報價。
上線後的設備監控、告警判讀與硬體報修均由值班團隊遠端接手;每筆事件的狀態、處置與時程全數留存,責任邊界清晰可稽。
叢集故障不只出現在 GPU 伺服器:交換機鏈路異常、管理節點排程失效、儲存掛載中斷,任一項都會使訓練中斷。維運需涵蓋整條路徑,計價依逐台台數與類別核算。
| 設備類別 | 維運項目 |
|---|---|
| GPU 伺服器 | 硬體告警監看、故障判讀、原廠 RMA 開立與追蹤 |
| 交換機 | 鏈路狀態監控、故障埠隔離、韌體版本控管 |
| 管理與儲存節點 | 排程服務可用性、掛載狀態、容量水位監看 |
| 負載平衡器 | 拓撲健康度、跨節點頻寬劣化偵測 |
依事件類別與服務等級模式而定。 斷電、斷網屬影響全案的事件,回應時效優先於一般設備報修,實際時限於合約依場域條件約定。
除 GPU 伺服器外,交換機、管理節點、儲存、負載平衡器與防火牆均須納入。叢集中斷有相當比例來自網路層而非運算節點,僅維運 GPU 會留下缺口。設備清單於簽約前確認,之後新增設備按台加計。
依設備台數與類別計算。 簽約前須提供一份逐台列出的設備清單作為計價基準,之後新增設備按台加計。
合約以年計,付款方式為月費,逐月請款。 建置完成到業主團隊接手之間的過渡期,可於合約中約定銜接條件。
每週產出服務紀錄,每月產出維運報告,內含告警統計、故障處理紀錄、RMA 進度,以及電力與溫度趨勢。
可以。業主技術人員能納入教育訓練,接手一線判讀與例行檢查,學研單位與設有內部 IT 的企業常採此模式。
康斯特自營與代營運的數據中心通過 ISO 27001:2022 認證, 提供全天候維運支援,並以工單系統追蹤事件、依 SLA 承諾服務水準。
提供設備清單,我們回覆維運範圍與服務等級。