科技

從EPYC到Helios,AMD與Meta攜手擴展AI的未來

Vendor Icon

CIO Taiwan

1 小時前

文/AMD

Meta與AMD正共同打造涵蓋完整技術堆疊的AI基礎設施,範圍涵蓋AMD Helios機櫃級解決方案、AMD EPYC CPU、AMD Instinct GPU、AMD Pensando™網路技術以及ROCm軟體,並全數針對Meta的AI工作負載進行最佳化。

雙方正針對gigawatt等級規模的部署進行設計,共同打造完整的AI系統,整合運算、記憶體、網路、電力、散熱與軟體,以加速大規模AI訓練與推論。

Meta正持續擴大跨多世代AMD產品的部署,並身為第6代AMD EPYC “Venice”的主要客戶,同時從AMD Instinct MI300X、MI350X逐步邁向以MI450為基礎的客製化GPU。

AI正在改變的不僅是資料中心的運作方式,更包括其設計方式。在Meta涵蓋訓練、推論、推薦與排序、內容,以及服務數十億用戶的全新AI體驗等領域,對AI基礎設施的需求正快速成長。要滿足這樣的需求,不僅僅是增加GPU或伺服器而已,更需要以業界前所未見的速度,在整個資料中心的擴展AI容量。

在Advancing AI 2026大會上,AMD董事長暨執行長蘇姿丰博士與Meta基礎設施負責人Santosh Janardhan展開對談,說明Meta如何因應下一階段的成長,以及和AMD等夥伴深化合作的重要性。

打造gigawatt等級規模的AI基礎設施

傳統資料中心架構通常著重於最佳化個別伺服器或元件,而AI改變了這個模式。如今,AI平台的效能取決於運算、網路、記憶體、電力、散熱與軟體之間協同運作的效率。以Meta的規模而言,這些元素已無法各自獨立設計。

整個基礎設施必須被視為單一整合式AI系統的方式進行工程設計,以在gigawatt等級規模下高效且穩定地運作。

這樣的轉變,為基礎設施營運商與技術夥伴之間更深入的合作開啟了大門。Meta與AMD並非在開發週期尾聲才選用現成元件,而是從晶片到軟體,共同校準需求與工程決策。彈性與規模同等重要,包括訓練、推論、推薦系統以及新興代理型應用,各自對基礎設施提出不同的需求。

攜手AMD EPYC,共同擴展AI規模

開放式異質架構讓Meta能夠針對不同工作負載搭配合適的硬體,同時維持整體機隊的高使用率。這正是Meta與AMD持續深化合作的基礎:共同打造多元且快速演進的AI工作負載組合所需的晶片、系統與軟體。

此次合作橫跨AMD EPYC處理器的多個世代,包括Milan、Bergamo、Turin,以及現在的Venice。Meta已在其基礎設施中部署數百萬顆EPYC CPU,並以“Venice”主要客戶的身分與AMD緊密合作,預期將為Meta的工作負載帶來更多核心數、更高效能、更佳效率,以及在Meta特別重視領域的客製化能力。Meta目前正在實驗室中驗證以“Venice”為基礎的平台,初步結果令人振奮,團隊也正為規模化部署做準備。

隨著AI系統日益走向代理化,CPU所扮演的角色也持續擴大。GPU仍是訓練與推論的核心,但CPU正逐漸承擔協調代理、執行工具、運行程式碼、管理資料,並協調AI模型周邊更廣泛系統運作的責任。隨著這些工作負載持續成長,CPU與GPU效能之間的平衡也變得更加關鍵。Meta計劃在既有“Venice”部署的基礎上,持續與AMD合作推進“Verano”以及未來世代的EPYC產品藍圖。

攜手Instinct GPU,共同打造AI基礎設施

雙方在GPU與機櫃級系統領域的合作,同樣也大幅成長。今年稍早,Meta透過Open Compute Project發表了Open Rack Wide(ORW)規範,定義出專為AI規模基礎設施打造的開放式機櫃架構。

AMD Helios機櫃級解決方案即建構於ORW標準之上,將AMD對開放性的承諾,從晶片與軟體延伸至系統、機櫃與大規模叢集。Helios整合了AMD Instinct™ GPU、EPYC處理器、AMD Pensando™網路技術以及ROCm軟體,打造出一套完整工程化的機櫃級平台,滿足gigawatt等級規模下所需的效能、能源效率與可維護性。

這樣共同的架構願景,讓雙方得以在每個世代的Instinct加速器上展開更深入的合作。這項合作始於MI300X,讓雙方累積了在超大規模環境下運行AMD Instinct,同時於AMD ROCm軟體上最佳化生產工作負載的經驗。MI350系列則將合作延伸至AI訓練領域,包括Meta平台核心的推薦與排序模型。

如今,Meta計劃部署以Instinct MI450為基礎的客製化GPU,展現雙方的合作已從產品部署,邁向深度、端到端的平台共同設計。

Meta已搶先取得Helios的使用權限,並已與雙方工程師攜手,在硬體、軟體與系統整合等面向共同測試該平台,為工作負載部署做準備。

這項工作將支援Meta部署最高達6 gigawatts規模、採用AMD GPU之基礎設施的計畫。在這樣的規模下,及早展開合作至關重要,因為電力、散熱、網路、記憶體與軟體等相關決策,無法等到最終驗證階段才進行,而必須從一開始就一併考量。

攜手打造下一世代AI基礎設施

下一代AI基礎設施的打造,將把資料中心視為一個完整系統,並在設計流程中更早期就校準工作負載、晶片、網路、系統與軟體。

這樣的合作,已開始影響AMD未來的平台發展,包括AMD Instinct MI500加速器以及下一代機櫃級系統。結合Meta為數十億用戶營運基礎設施的經驗,以及AMD在CPU、GPU與系統藍圖上的規劃,雙方期望能以更快的速度、更高的效率部署AI容量,並具備未來工作負載所需的彈性。

The post 從EPYC到Helios,AMD與Meta攜手擴展AI的未來 first appeared on CIO Taiwan.
author avatar
CIO Taiwan
IDG集團的媒體品牌CIO於1987年創刊,為國際性最權威的IT管理專業雜誌。擁有全球最頂尖的IT管理專家作者群,因此能寫出最權威的分析評論、最先進的IT管理觀念。
donate plan

充電計畫

喜歡這篇文章嗎?歡迎幫作者充電,好內容值得更多人支持

瞭解詳情