嵌入式AI的典型架構有一個特點,由于嵌入式設備算力有限,行業普遍采用“訓練-推理分離”模式,即在服務器端訓練模型,再在嵌入式設備執行推理。硬件架構上,通常結合專用加速器(如NPU)與通用計算單元(如RISC-V VPU)。

“NPU適合固定算子加速,但缺乏靈活性;而RISC-V VPU通過向量擴展,可隨算子演進而升級,成為通用加速的理想選擇。”——

芯來科技嵌入式軟件工程師舒卓
7月18日,于上海舉辦的RISC-V中國峰會人工智能分論壇上,芯來科技嵌入式軟件工程師舒卓以《Nuclei AI Library,使用RISC-V擴展加速AI推理》為題,系統闡釋了RISC-V V擴展在嵌入式AI領域的創新實踐。他指出,面對嵌入式設備算力有限的挑戰,芯來科技通過Nuclei AI Library與RISC-V V擴展的深度融合,為AI推理提供了高效、靈活的加速方案。

針對嵌入式AI“訓練-推理分離”的典型架構,舒卓指出了專用加速的局限性——DSA或NPU雖算力強,但靈活性不足,難以適配快速演進的AI算子。而RISC-V V擴展通過指令集擴展,可隨算子需求靈活升級,成為嵌入式AI通用加速的理想選擇。
Nuclei AI Library填補NPU空白,實現算子級優化
芯來科技推出的Nuclei AI Library,旨在通過RISC-V V擴展為NPU提供補充方案。舒卓強調:“客戶對高算力需求通常采用NPU加速,但對于自定義算子或不適合NPU的場景,V擴展的靈活性至關重要。”該庫的核心優化策略包括:
1. GEMM算子優化:榨取每一寸算力
通用矩陣乘(GEMM)是AI模型中占比最高的算子(據IBM研究,占比超50%)。芯來科技通過三項技術提升其效率:
避免低效指令:減少Reduction類指令的使用;
數據復用:最大化已加載數據的利用率,減少內存訪問;
寄存器滿載:充分利用V數據寄存器容量,提升計算密度。
在Nuclei NX900fdv平臺的實測中,GEMM算子性能提升顯著:
16×16矩陣:加速8.51~14.23倍;
128×128矩陣:加速最高達89.96倍。

2. CONV2D算子優化:兩種路徑適配不同場景
針對卷積神經網絡的核心算子CONV2D,芯來科技提供兩種優化方案:
Im2col+GEMM:將卷積轉化為矩陣乘法,適配大尺寸卷積核;
Winograd+GEMM:減少小尺寸卷積核的計算量,再通過GEMM加速。
在Nuclei Evalsoc平臺的測試中,多種AI算子(如Abs、Add、BatchNormalization)的加速倍數從數倍到上百倍不等,印證了V擴展在多樣化場景中的普適性。

3. BF16格式優化:突破精度與效率的平衡
為適應AI對低精度計算的需求,芯來科技自定義了BF16格式的V擴展指令:
CS寄存器創新:通過設定不同CSR寄存器值,直接以BF16格式計算,避免官方擴展中“BF16轉FP32”的額外開銷;
性能躍升:相比RISC-V官方BF16擴展,性能提升超1倍,同時帶寬需求降低50%。

矩陣擴展與協同架構:釋放RISC-V生態潛力
芯來科技同步引入矩陣擴展(如Xxlvqmacc指令),遵循IME group規范設計,支持8位整數擴展至32位精度,進一步拓寬了RISC-V在AI領域的應用邊界。舒卓指出,Nuclei AI Library與NPU的協同模式已成為嵌入式AI的主流方案。

在分工協作方面,NPU處理專用算子(如大規模卷積),V擴展處理靈活算子(如自定義層)。以圖像識別場景為例,NPU負責特征提取,V擴展加速全連接層分類,整體性能提升30%以上。
舒卓總結,RISC-V V擴展的開源特性與算子統一趨勢,為嵌入式AI提供了“通用加速與專用加速互補”的新路徑。芯來科技將持續優化Nuclei AI Library,推動RISC-V在邊緣計算、智能家居等場景的落地,助力AI從“識別”向“認知”的更深層次演進。