亞馬遜云科技(AWS)在AWS re:Invent全球大會上,正式推出第三代AI訓練芯片Trainium3,并同步披露下一代Trainium4研發進展。這款基于臺積電3nm工藝打造的芯片,幫助企業更快地訓練更大的人工智能模型,旨在沖擊英偉達、谷歌等頭部玩家的AI芯片市場格局。

據亞馬遜云科技(AWS)披露,Trn3 UltraServers 將多達 144 個 Trainium3 芯片集成到單個系統中,計算性能比 Trainium2 UltraServers 提升高達 4.4 倍。
在使用 OpenAI 的開源權重模型 GPT-OSS 對 Trn3 UltraServer 進行測試時,客戶可以實現比 Trn2 UltraServer 高 3 倍的單芯片吞吐量,同時響應速度提升 4 倍。
Trainium3 還顯著降低了能耗——與上一代產品相比,能效提升了 40%。
公司表示,與同樣使用圖形處理單元(GPU)的系統相比,訓練和運行AI模型的成本能夠降低最多50%。
AWS 將 Trn3 UltraServer 設計成一個垂直整合的系統——從芯片架構到軟件棧。這種整合的核心是網絡基礎設施,旨在消除通常限制分布式 AI 計算的通信瓶頸。全新的 NeuronSwitch-v1 為每個 UltraServer 提供兩倍的帶寬,而增強的 Neuron Fabric 網絡則將芯片間的通信延遲降低到不到 10 微秒。
對于需要擴展的客戶而言,EC2 UltraClusters 3.0 可以連接數千臺 UltraServer,每臺服務器最多可包含 100 萬個 Trainium 芯片,是上一代的 10 倍。
不過,亞馬遜拒絕透露新款AI芯片與谷歌、英偉達最新產品的基準性能對比,也未披露功耗參數。
此次發布的一大亮點則是亞馬遜對AI戰略的重新定位。下一代Trainium4將首次集成英偉達NVLink Fusion技術,實現與GPU的協同工作。
亞馬遜表示,“為了實現更強大的擴展性能,Trainium4 專為支持 NVIDIA NVLink Fusion 高速芯片互連技術而設計。這種集成將使 Trainium4、Graviton 和 Elastic Fabric Adapter (EFA) 能夠在通用的 MGX 機架中無縫協作,為您提供經濟高效的機架級 AI 基礎架構,同時支持 GPU 和 Trainium 服務器。最終打造出一個靈活的高性能平臺,專為高要求的 AI 模型訓練和推理工作負載而優化。”
Trainium4旨在全面提升性能,包括至少 6 倍的處理性能 (FP4)、3 倍的 FP8 性能以及 4 倍的內存帶寬,以支持新一代前沿訓練和推理。
AWS首席執行官Matt Garman強調:“我們不是要取代英偉達,而是通過融合共存創造更大價值。”亞馬遜轉向“生態互補”,既保留自研芯片的成本優勢,又借助英偉達軟件生態吸引更多開發者。
分析人士認為,隨著全球AI競賽加劇,科技巨頭紛紛尋求降低對英偉達GPU的依賴。
亞馬遜自研的Trainium芯片,盡管在性能和成本上具備優勢,但其采用范圍確實仍相對有限,尚未在更廣泛的AI頭部企業中成為主流選擇。亞馬遜及其投資的Anthropic是Trainium最主要和知名的用戶,亞馬遜不僅自身使用,還通過投資與協議,推動其投資的AI公司Anthropic大規模采用Trainium芯片來訓練模型。亞馬遜指出,通過Project Rainier項目,AWS與Anthropic合作,將超過50萬個Trainium2芯片連接到全球最大的AI計算集群,其規模是Anthropic上一代模型訓練基礎設施的五倍。Trainium3在此成熟基礎上進一步擴展了UltraCluster架構,為下一代大規模AI計算集群和前沿模型提供更卓越的性能。
與英偉達CUDA平臺歷經多年建立的、極其豐富且穩定的開發者生態相比,亞馬遜的芯片軟件庫在深度和易用性上仍被認為是主要的短板。這對于追求開發效率與穩定性的企業而言是關鍵考量。
目前全球AI訓練市場由英偉達GPU主導,絕大多數大型科技公司和AI初創公司已圍繞其構建了完整的技術棧。
即使是核心伙伴Anthropic,也并未獨家采用Trainium。它同時與谷歌(使用TPU)和英偉達簽署了大規模的算力采購協議,以保障供應鏈安全并優化性價比。可見頭部AI公司傾向于采用多供應商策略,而非綁定單一架構。
而通過與英偉達技術的未來融合,亞馬遜似乎在尋求一條合作與競爭并存的發展路徑,為客戶提供更多元化的AI算力選擇。