隨著生成式AI和智能體(Agentic AI)的興起,對算力的需求呈現爆炸式增長。然而,將所有計算任務都上傳至云端,不僅面臨高昂的帶寬成本與網絡延遲,更在數據隱私、系統韌性和能耗方面遭遇瓶頸。正是在這樣的背景下,邊緣AI應運而生,并迅速成為物聯網發展的主導性技術。

10月30日,繼上海、首爾之后,Arm Unlocked 2025 AI技術峰會深圳站圓滿落幕。這場以“驅動AI從云到端落地”為主題的盛會,吸引了超過1,500位來自產業鏈各環節的行業專家、企業領袖與開發者。在四大主題分論壇中,“邊緣AI”無疑成為最炙手可熱的焦點。

Arm物聯網事業部硬件產品管理高級總監Lionel Belnet
“人工智能的未來在邊緣。”在峰會邊緣AI專場上,Arm物聯網事業部硬件產品管理高級總監Lionel Belnet直擊未來核心。不同于將 AI 描繪成遙遠圖景,他堅定強調:“這并不是遙遠的未來,而是此刻正在發生的現實。AI與邊緣計算的融合,正在重塑工程師構建智能系統的方式,從操作系統到編程語言,各個環節都在經歷深刻的變革。”

AI為何重新定義邊緣計算?低延遲、高隱私、強韌性成關鍵驅動力
根據SHD Group發布的《邊緣AI市場分析報告》,到2030年,基于邊緣AI的系統級芯片(SoC)市場規模預計將達到800億至1,000億美元。VDC Research的報告則指出,到 2028年,AI將成為物聯網各類項目中應用占比最高的技術。Edge AI Foundation的預測同樣樂觀:到2028年,邊緣AI基礎設施投資將增長60%以上。

Lionel 指出,在邊緣 AI 邁向通用人工智能 (AGI) 的過程中,有五大關鍵特性至關重要,延遲、隱私安全、能效、成本和系統韌性,正推動著這一領域的快速進步。
“對于人機界面而言,延遲和響應速度至關重要。”Lionel 解釋道,“無論是語音助手的交互、智能家居的控制,還是工業機器人的人機協作,用戶都需要即時反饋。而更重要的是數據隱私——必須保護用戶的個人數據和企業的敏感信息,避免云端傳輸引發的泄露風險。”

除了低延遲和高隱私,邊緣AI還具備顯著的能效優勢。通過在設備端完成計算,邊緣 AI 減少了對網絡和云端的依賴,大幅降低了整體能耗與運營成本。同時,即使在網絡中斷的情況下,設備依然能夠離線運行,這極大地增強了系統的韌性與可靠性。
“始終在線(Always-on)的感知能力,是提升邊緣設備交互體驗的核心路徑之一。” Lionel 強調。這種能力使得設備能夠持續感知環境、理解用戶意圖,并在本地完成復雜AI模型的推理,從而實現更自然、更直觀的人機交互。
從智能音箱的語音喚醒,到工廠產線的視覺質檢,再到服務機器人的場景理解,邊緣AI 正在重塑人與機器的交互方式。正如 Lionel 所展示的愿景:“AI is Revolutionizing the Human Machine Interface”(AI正在徹底改變人機界面)。
Cortex-A320與Ethos-U85的平臺組合,為邊緣AI 注入強勁動力
為應對邊緣側日益復雜的AI工作負載,Arm在今年推出了其首款超高能效的Armv9架構CPU——Cortex-A320,并與新一代NPU Ethos-U85組成黃金搭檔,共同構成專為物聯網優化的高性能邊緣AI計算平臺。

在媒體溝通會上,Lionel 詳細解讀了Cortex-A320的技術突破。相較于前代產品Cortex-A35,Cortex-A320實現了機器學習 (ML) 性能提升10倍,標量性能提升30%,標志著一次重大的技術飛躍。
Lionel 解讀道:“這個10倍指的是計算密度。”這一提升得益于Armv9架構的多項創新,包括第二代可伸縮矢量擴展 (SVE2)、增強型Neon 以及矩陣乘法指令等,使得每一代架構迭代都能帶來接近一倍的性能增益。
在安全性方面,Cortex-A320將Armv9特有的安全功能下放至成本敏感的邊緣設備,充分體現了Arm對物聯網安全的高度重視。Lionel 介紹,這些新特性包括:
- Secure EL2:增強TrustZone內部的隔離性,支持更安全地運行軟件容器。
- 指針驗證/分支目標識別 (PAC/BTI):有效緩解跳轉和返回編程 (JOP/ROP) 攻擊,提升控制流完整性。
- 內存標記擴展 (MTE):通過內存標記機制,使黑客更難利用常見的內存安全漏洞進行攻擊。

“隨著邊緣應用場景變得更加復雜,設備端軟件和數據的價值也在不斷提升,安全對于確保數據隱私和安全連接至關重要。” Lionel 表示,“我們特別強調的是,這些新的安全功能不會增加額外的硬件成本,因為它們已在Linux、編譯器和工具鏈中得到廣泛支持,并在消費市場得到驗證。”
與此同時,Ethos-U85 NPU作為Arm迄今為止性能最強、能效最高的微控制器級神經網絡處理器,為邊緣AI提供了專用的硬件加速能力。其可配置的MAC(乘加運算單元)數量從128到2048不等,峰值性能可達4TOPS,能夠高效運行包括大語言模型 (LLM) 在內的復雜AI算法。

在架構設計上,CPU與NPU并非相互替代,而是協同工作。對于CPU、Neon、SVE2、Ethos如何分工,Lionel 指出:“在模型開發生命周期中,CPU通常是實現初步部署與驗證的首選平臺。當模型在CPU上表現穩定后,開發者可進一步優化并將其遷移至NPU以實現更高效率。NPU提供極致效率,而CPU則持續提供架構靈活性,支持多樣化數據類型,并能通過向量擴展分流或運行特定算子。”
這種“CPU+NPU”的組合,尤其適用于可穿戴設備、智能傳感器、工業控制器等對能效和實時性要求極高的場景。例如,在基于Cortex-M85與Ethos-U85組合的MCU上,Arm 已成功演示了高速、低延遲的語音識別模型,實現了“始終在線”的超低功耗語音交互,而無需依賴云端計算。

Armv9邊緣AI計算平臺加速產業創新
如果說Cortex-A320和Ethos-U85是“發動機”,那么Armv9邊緣AI計算平臺就是一輛完整的“整車”。Arm正通過平臺化戰略,為合作伙伴提供從硬件IP、軟件棧到開發工具的完整解決方案,大幅降低邊緣AI產品的開發門檻與周期。

該平臺以Cortex-A320 CPU和Ethos-U85 NPU為核心,專為物聯網應用優化,支持運行超過10億參數的端側AI模型。這意味著像TinyLlama、Phi-3 Mini等輕量級大語言模型,完全可以在資源受限的邊緣設備上實現本地推理。
“Armv9邊緣AI計算平臺在高效能與安全性方面均實現了顯著提升。” Lionel 表示,“通過SVE2指令集,平臺優化了DSP任務處理效能,使得智慧攝像頭、語音界面等應用能夠更高效地運行。同時,MTE等安全特性有效防止了內存安全漏洞,提高了系統的整體安全性。”

除了硬件層面的創新,Armv9邊緣AI計算平臺還得到了Arm軟件生態的廣泛支持。Arm KleidiAI開源AI庫的引入,進一步優化了CPU上的AI工作負載,使得開發人員能夠無縫整合領先的AI框架,如PyTorch和TensorFlow,簡化了邊緣AI的開發流程。
“Arm KleidiAI在Llama.cpp上運行微軟Tiny Stories數據集時,為Cortex-A320帶來了高達70%的效能提升。”Lionel舉例說明,“這種軟件層面的優化,使得開發人員能夠更快速地部署AI應用,縮短了產品上市時間。”

為加速生態普及,Arm已將Armv9邊緣AI計算平臺納入Arm Flexible Access技術授權訂閱方案。這一靈活的商業模式允許合作伙伴,尤其是初創企業,在前期以低成本甚至免費的方式,獲取Arm廣泛的技術、工具及資源支持,進行原型設計和產品開發。
“截至目前,Arm Flexible Access方案已擁有超過300家活躍成員,其中中國合作伙伴超過70家,包括帝奧微電子、摩芯半導體、杭州芯勢力等。” Lionel 透露,“過去五年間,通過該方案實現的成功流片約達400次,為整個生態系統注入了快速創新的動力。”
在具體應用層面,Armv9邊緣AI計算平臺已在多個領域展現出巨大潛力。Lionel 舉例說明,在工業自動化場景中,即使網絡連接中斷,基于該平臺的設備仍能依靠本地智能安全、持續地運行,實現預測性維護、計算機視覺質檢等關鍵功能。

此外,Arm還致力于確保邊緣設備在整個生命周期內的合規性與可維護性。“我們提供長期支持與年度更新,確保產品在整個生命周期內保持安全。” Lionel 表示,“同時,我們通過Arm System Ready項目,確保軟硬件之間的互操作性與兼容性。考慮到許多工業產品需要運行7年、10年甚至15年,我們必須提供一個長期可維護的解決方案。”
從PyTorch到KleidiAI構建開放生態,打通云到端的AI開發鏈路
技術的先進性只是第一步,生態的繁榮才是決定邊緣AI能否大規模落地的關鍵。Arm深知這一點,正通過一系列開源項目與框架合作,構建一個開放、標準化的邊緣AI生態系統。

一個標志性事件是Arm與Meta的緊密合作,共同發布了ExecuTorch 1.0正式版。ExecuTorch是一個專為邊緣設備優化的PyTorch運行時,它允許開發者使用熟悉的PyTorch工作流,在數十億基于Arm架構的邊緣設備上無縫部署AI模型,真正做到“開箱即用”。
“這不僅有助于提升開發效率,也帶來了更便捷的體驗。” Lionel 評價道。通過ExecuTorch,開發者可以避免繁瑣的模型轉換和優化過程,將更多精力集中在應用創新上。

與此同時,Arm推出的KleidiAI軟件庫也在生態建設中扮演著核心角色。KleidiAI 是一個高度優化的AI推理軟件庫,已集成到Llama.cpp、ExecuTorch和LiteRT等多個主流AI框架中,能夠對Meta Llama 3、Phi-3等主流大模型進行加速,進一步釋放Arm架構的AI 計算性能。

在中國市場,Arm也積極與本土AI框架對接。Lionel 在采訪中透露,Arm已與百度合作,在Arm Ethos-U85 NPU上成功部署了九款經典的PaddleLite視覺模型。”此外,Arm 還提供豐富的參考設計和開發工具包(如ML Embedded Evaluation Kit),幫助開發者快速評估性能、測試軟件棧并實現定制化工作流。
“衡量邊緣AI生態系統的成功,雖然難以直接量化,但其核心標準在于創新活力。” Lionel 總結道,“Arm致力于構建一個開源、標準化的生態系統,通過提供開放標準與開源資源,賦能開發者在生態內自主獲取所需工具,持續激發創新潛能。”
深耕中國:本地化策略與未來展望
中國是全球最大的物聯網市場之一,也是邊緣AI創新最活躍的地區。面對中國市場的獨特需求與國產化趨勢,Arm采取了積極的本地化策略。
“我們一直與中國本地合作伙伴保持著密切合作關系。” Lionel 表示,這不僅包括與百度等主流AI框架的深入對接,也涵蓋了與產業生態伙伴的具體協作與聯合創新。

談及未來三到五年邊緣AI在中國的爆發點,Lionel 認為工業自動化將率先引領應用落地。“制造商正將自動化控制、預測性維護以及基于計算機視覺的質檢技術部署到工廠生產場景中。”他指出,“智能家居與可穿戴設備(如智能眼鏡)將緊隨其后,目前已展現出強勁發展勢頭。此外,智慧城市領域也將快速成長,本地化且注重隱私保護的AI處理技術,能有效優化能源利用和交通管理。”
對于國內芯片企業自研NPU的趨勢,Lionel 認為這并不會導致同質化。“雖然多數合作伙伴可能采用相同的NPU,但他們的差異化并不一定體現在計算能力上,而更多來源于外設設計、開發工具、所提供的模型、市場策略以及針對特定市場的差異化方案。”他強調,“Arm的優勢在于提供一個可擴展的解決方案和完整的軟件生態系統,合作伙伴可以根據終端產品特性和市場策略,實現真正的產品差異化。”
面對國產化替代的浪潮,Lionel 認為Arm的應對之道在于持續創新。“特別是在邊緣AI領域,這意味著要為整個生態系統提供更強大的軟件支持,賦能合作伙伴。”他總結道,具體有三個關鍵點:持續的技術創新、優化的商業模式與靈活的可獲取性,以及廣泛的軟件生態構建。

“The edge isn't where intelligence ends. It's where it begins.(AI的終點不在邊緣,而是始于邊緣。)” Lionel 在演講結尾再次強調。從Cortex-A320與Ethos-U85的硬件革新,到 Armv9邊緣AI計算平臺的完整交付,再到ExecuTorch與KleidiAI驅動的開放生態,只有推動AI計算從云端走向設備端,才能讓智能真正融入萬物,觸手可及。