
文/AMD
AMD與Cerebras Systems宣布達成技術合作夥伴關係,推出結合AMD Helios機櫃級解決方案與Cerebras晶圓級引擎(Wafer-Scale Engine)的全新解構式AI推論解決方案。此解決方案於AMD Advancing AI 2026大會上首次亮相,旨在提供最先進AI應用所需的超低延遲,同時大幅提升吞吐量與效率。
AMD與Cerebras Systems的聯合解決方案,將部署AMD Helios並整合Cerebras晶圓級引擎技術於單一推論工作流程中,以實現極致的效能與效率。AMD Helios提供高效能且可擴展的吞吐量引擎,Cerebras晶圓級引擎技術則提供超快速、超低延遲的Token生成能力。兩大運算引擎結合,預計可提供高達5倍的每瓦每秒Token數(T/s/W)。
AI推論工作負載在延遲、吞吐量、Token容量、成本以及擴展規模方面的需求日益多元化。大量工作負載優先考量最大化Token生成量,而程式碼編寫、即時Copilot、即時代理與代理式工作流程則需要更快的回應時間。這些差異正推動對異質基礎設施(Heterogeneous Infrastructure)的需求,使其能精準匹配運算技術與特定工作負載的需求。
AMD與Cerebras Systems的解決方案透過解構式推論(Disaggregated Inference)解決這項挑戰,並針對工作流程中的兩個主要階段進行最佳化。AMD Helios以超高吞吐量處理提示詞與大型上下文視窗;Cerebras晶圓級引擎則加速記憶體頻寬密集型的解碼階段,以超低延遲生成Token。透過將這兩項頂尖引擎整合於單一工作流程中,雙方打造出具差異化優勢的超低延遲推論平台,且無須犧牲吞吐量或擴展規模。
AMD董事長暨執行長蘇姿丰博士表示:「AI推論正成為AI領域中最大的基礎設施發展機會之一,而其日益增長的多樣性需要更具彈性的方案。AMD Helios為最廣泛的推論工作負載提供領先業界的效能與擴展規模。透過與Cerebras合作,我們正將這項領先優勢延伸至對延遲極為敏感的應用領域,並為即時代理式AI打造強大的全新平台。」
Cerebras Systems執行長暨共同創辦人Andrew Feldman表示:「超高速推論的需求正以前所未有的速度快速成長。Cerebras提供全球最快速的超低延遲推論能力。與AMD合作,讓我們有絕佳機會將這項效能帶給更多客戶。」
隨著AI邁向軟體開發、自主代理、機器人技術、科學發現等回應時間直接影響使用者體驗與系統實用性的應用領域,快速的Token生成變得越來越重要。這項聯合解決方案整合了專為這些需求打造的互補架構。
AMD Helios提供處理大量複雜請求所需的高吞吐量的提示詞引擎、機櫃級效率與部署規模,Cerebras晶圓級引擎技術則提供即時傳回Token所需的超低延遲效能。其成果是專為推論市場中超低延遲領域所設計的解決方案,並以AMD Helios作為整個資料中心高吞吐量與平衡推論工作負載的基礎。
The post AMD與Cerebras Systems宣布推出領先業界的超低延遲與高吞吐量AI推論解決方案 first appeared on CIO Taiwan.