NPU適合固定算子加速,但缺乏靈活性;而RISC-V VPU通過向量擴展,可隨算子演進而升級,成為通用加速的理想選擇。

嵌入式AI的典型架構有一個特點,由于嵌入式設備算力有限,行業普遍采用“訓練-推理分離”模式,即在服務器端訓練模型,再在嵌入式設備執行推理。硬件架構上,通常結合專用加速器(如NPU)與通用計算單元(如RISC-V VPU)。

 “NPU適合固定算子加速,但缺乏靈活性;而RISC-V VPU通過向量擴展,可隨算子演進而升級,成為通用加速的理想選擇。”——

芯來科技嵌入式軟件工程師舒卓

7月18日,于上海舉辦的RISC-V中國峰會人工智能分論壇上,芯來科技嵌入式軟件工程師舒卓以《Nuclei AI Library,使用RISC-V擴展加速AI推理》為題,系統闡釋了RISC-V V擴展在嵌入式AI領域的創新實踐。他指出,面對嵌入式設備算力有限的挑戰,芯來科技通過Nuclei AI Library與RISC-V V擴展的深度融合,為AI推理提供了高效、靈活的加速方案。

針對嵌入式AI“訓練-推理分離”的典型架構,舒卓指出了專用加速的局限性——DSA或NPU雖算力強,但靈活性不足,難以適配快速演進的AI算子。而RISC-V V擴展通過指令集擴展,可隨算子需求靈活升級,成為嵌入式AI通用加速的理想選擇。

Nuclei AI Library填補NPU空白,實現算子級優化

芯來科技推出的Nuclei AI Library,旨在通過RISC-V V擴展為NPU提供補充方案。舒卓強調:“客戶對高算力需求通常采用NPU加速,但對于自定義算子或不適合NPU的場景,V擴展的靈活性至關重要。”該庫的核心優化策略包括:

1. GEMM算子優化:榨取每一寸算力

通用矩陣乘(GEMM)是AI模型中占比最高的算子(據IBM研究,占比超50%)。芯來科技通過三項技術提升其效率:

避免低效指令:減少Reduction類指令的使用;

數據復用:最大化已加載數據的利用率,減少內存訪問;

寄存器滿載:充分利用V數據寄存器容量,提升計算密度。

在Nuclei NX900fdv平臺的實測中,GEMM算子性能提升顯著:

16×16矩陣:加速8.51~14.23倍;

128×128矩陣:加速最高達89.96倍。

2. CONV2D算子優化:兩種路徑適配不同場景

針對卷積神經網絡的核心算子CONV2D,芯來科技提供兩種優化方案:

Im2col+GEMM:將卷積轉化為矩陣乘法,適配大尺寸卷積核;

Winograd+GEMM:減少小尺寸卷積核的計算量,再通過GEMM加速。

在Nuclei Evalsoc平臺的測試中,多種AI算子(如Abs、Add、BatchNormalization)的加速倍數從數倍到上百倍不等,印證了V擴展在多樣化場景中的普適性。

3. BF16格式優化:突破精度與效率的平衡

為適應AI對低精度計算的需求,芯來科技自定義了BF16格式的V擴展指令:

CS寄存器創新:通過設定不同CSR寄存器值,直接以BF16格式計算,避免官方擴展中“BF16轉FP32”的額外開銷;

性能躍升:相比RISC-V官方BF16擴展,性能提升超1倍,同時帶寬需求降低50%。

矩陣擴展與協同架構:釋放RISC-V生態潛力

芯來科技同步引入矩陣擴展(如Xxlvqmacc指令),遵循IME group規范設計,支持8位整數擴展至32位精度,進一步拓寬了RISC-V在AI領域的應用邊界。舒卓指出,Nuclei AI Library與NPU的協同模式已成為嵌入式AI的主流方案。

分工協作方面,NPU處理專用算子(如大規模卷積),V擴展處理靈活算子(如自定義層)。以圖像識別場景為例,NPU負責特征提取,V擴展加速全連接層分類,整體性能提升30%以上。

舒卓總結,RISC-V V擴展的開源特性與算子統一趨勢,為嵌入式AI提供了“通用加速與專用加速互補”的新路徑。芯來科技將持續優化Nuclei AI Library,推動RISC-V在邊緣計算、智能家居等場景的落地,助力AI從“識別”向“認知”的更深層次演進。

責編:Luffy
本文為EET電子工程專輯原創文章,禁止轉載。請尊重知識產權,違者本司保留追究責任的權利。
閱讀全文,請先
您可能感興趣
從增長曲線看,數據中心目前占美國總用電量的5.9%,預計到2030年升至約12%,2035年進一步攀升至20%——不到十年時間,占比擴大逾三倍。
分析機構Needham在6月曾預測,英偉達可能正在規劃一項規模龐大的通信網絡項目,未來三年的投資規?;蚋哌_50億至100億美元。
這是鴻海首次切入馬斯克體系內的AI基礎設施供應鏈,也意味著戴爾(Dell)、超微(Super Micro)兩家長期主導SpaceX AI服務器供應的廠商,被正面撬動。
這意味著,AI驅動的存儲超級周期對三星手機業務的沖擊力,已經超過了其史上最嚴重的產品安全危機。
黃文德在采訪中強調,臺積電正面臨客戶端持續涌現的“長達數年的超級需求浪潮”。
2026年,在工業自動化、新能源汽車及智能裝備的強勁需求下,電機驅動與控制技術正迎來系統性重構。
“通用處理器”這一術語一直被廣泛用于描述可運行各類軟件工作負載的CPU。在現代基于Arm架構的系統級芯片(SoC)領域,這一稱謂仍被廣泛使用,但隨著系統復雜度不斷提升,我們有必要追問:這類器件在實際應用中,究竟有多“通用”?
隨著AI基礎設施分化為多層專用架構,CPU正成為智能體工作負載的編排層。
本屆WAIC期間,《2026全球AI商業落地價值洞察報告》重磅發布,并在大會的兩大高規格論壇上進行了重點展示。作為大會最受關注的產業研究成果之一,這份報告以“從技術爆發到價值兌現”為主線,系統梳理了全球AI產業的競爭格局與商業落地路徑。 镕銘微電子憑借在VPU賽道上的開創性地位與規模化商業落地能力,成功入選該報告的兩大核心榜單,與全球及國內頂尖科技企業同臺亮相。
NVIDIA?已驗證?ST?的?12?kW?電源傳輸概念驗證板,實際上已進入生產測試階段。
點擊上方藍字談思實驗室獲取更多汽車網絡安全資訊7月23-24日,由AI基礎設施圈和談思科技主辦、東莞市集成電路行業協會作為支持單位的「CPO Asia 2026 亞洲光電共封裝技術創新大會」將在上海盛
一覽眾咨詢公司專注于汽車產業鏈領域的產業研究、咨詢及品牌推廣。經過多年的發展,公司在汽車領域積累較深的行業經驗及客戶資源,是該領域專業權威的第三方市場研究咨詢機構。一覽眾咨詢公司主要業務包括:市場調研
點擊藍字 關注我們SUBSCRIBE to USImage Credits:Google谷歌母公司Alphabet正在自研一款全新服務器芯片,用以提升自研大模型Gemini的運行能效。科技媒
一個令人震驚的數據:在移動互聯網幾乎無處不在的當下,國內網吧卻開始逆勢增長。根據中國互聯網上網服務行業協會數據,過去一年,中國網吧經營主體達12.26萬家,同比增長12.68%;營收規模突破1016.
點擊藍字 關注我們SUBSCRIBE to USImage Credits:Malte Mueller / Getty ImagesMeta正在開發一款名為StoryKit的AI故事創作應用
“今天,我想坦誠告訴大家:realme將按下中國市場的暫停鍵!”隨著7月16日晚上,realme副總裁徐起在社交媒體上發布致用戶公開信,這個在中國市場運營七年的年輕品牌,也正式按下了暫停鍵。當初,re
開關電源波形測量不能只標一個 TP 編號。測量結果由信號節點、參考節點、探頭帶寬與連接環路共同決定;高壓一次側還涉及儀器接地與額定能力。先定義參考和安全邊界,再解釋尖峰、反射與電流波形。調試電源時,最
當前,AIDC數據中心、新能源汽車、人形機器人、家電、消費電子、儲能等領域正迎來高速增長與高質量發展的雙重浪潮,亟須突破性電源轉換(電力電子變換)新技術方案,以破解系統能效提升、功率密度升級、綜合成本
全面收縮戰線”作者|王磊編輯|秦章勇真是給大眾逼的沒招兒了。過去一段時間,大眾裁員這件事,已經造成不小的震動,一個最醒目的數字就是,大眾未來幾年全球裁員將多達10萬人,并考慮關閉德國多座工廠等,只不過
算筆賬一批十萬的呆料壓在庫存每月倉儲費?資金成本至少5k放半年就虧3萬有料單不知道怎么推廣?芯片超人已經累計服務2.2萬用戶,打折清庫存,最快半天完成交易!找不到,賣不掉,價格還想再好點,都可以來找我