AI發展進程中,將越來越多地在邊緣實現機器學習和運算。不過,在邊緣運行機器學習算法語言,在可重構性、功耗、延遲、成本、尺寸和易開發性等諸多方面,都遇到明顯的技術瓶頸。本文討論如何通過在創新量子計算架構上創建FPGA,實現靈活可重構性,并有效克服基于邊緣設備的所有障礙,實現可擴展嵌入式處理解決方案。

針對在邊緣運行機器學習算法而言,在可重構性、功耗、尺寸、速度和成本方面,FPGA超越了多種其他方式的人工智能芯片組。此外,與微體系架構無關的RISC-V指令集體系架構(ISA)能夠與FPGA的體系架構靈活性無縫結合。然而,一個主要瓶頸就是明顯缺乏成本效益高的中端FPGA,而且設計流程也比較復雜。另外,也很難找到用于實現完全自定義硬件描述語言(HDL)所需的軟件技術,而且還往往伴隨著陡峭的學習曲線。

易靈思利用在創新量子計算架構上建立的FPGA填補了這一空白,該架構由可重新配置模塊組成,被稱為可交換邏輯和路由(XLR)單元,作為邏輯或路由,重新優化了邏輯元件(LE)和路由資源的傳統固定比率,從而支持在小型器件封裝中利用高密度架構,其中FPGA的所有資源都被充分利用。該平臺的潛力超越了當今基于邊緣的設備面臨的典型障礙:功耗、延遲、成本、尺寸和易開發性。

易靈思FPGA最引人注目的特點,可能是其周圍的生態系統和最先進的工具流,這降低了開發門檻,使設計師能夠利用同等的硅,在邊緣輕松實現人工智能(從原型到量產)。通過采用RISC-V,從而允許用戶在軟件中創建應用程序和算法,利用該ISA的易編程性,而不必綁定到ARM等專有IP核上。由于這一切都是通過靈活的FPGA架構完成的,用戶可以在硬件上大幅加速。另外,易靈思還同時支持低級別和更復雜的自定義指令加速。其中一些技術包括TinyML加速器和預定義的硬件加速器sockets。通過這樣的方法,所實現的跳躍式加速既提供了硬件性能,同時又保留了軟件定義模型,從而可以在不需要學習VHDL的情況下進行迭代和細化。其結果使得邊緣設備的速度極快,同時功耗低,占位面積小。本文詳細討論了易靈思平臺如何簡化整個設計和開發周期,讓用戶能夠利用靈活的FPGA架構,來實現可擴展的嵌入式處理解決方案。

邊緣面臨的設計障礙

從大規模的無線傳感器網絡,到流式傳輸高分辨率360度沉浸式AR或VR體驗,現實世界中大多數數據都處于邊緣。將運算負荷從云中剝離出來,并使其更接近邊緣設備,為自動駕駛、沉浸式數字體驗、自動化工業設施、遠程手術等下一代帶寬密集型、超低延遲等應用打開了大門。一旦避開了從云端傳輸數據的巨大障礙,用例就會層出不窮。

然而,對于邊緣而言,低延遲、高耗能運算這類決定性因素,正是對這些體積小且功率有限的設備帶來重大設計挑戰的主要因素。那么,如何設計一種設備,既能處理耗電的ML算法,而又不需要采用復雜的技術呢?該解決方案的硬件可以是任何類型(例如,CPU、GPU、ASIC、FPGA、ASSP),但資源要足以運行合適的應用程序和算法,同時又能夠加速密度更高的運算任務,并能平衡運算時間(延遲)和所用資源(功耗)。

與任何創新一樣,隨著模型和優化技術的更新,深度學習的環境也在不斷變化,這就需要利用更靈活的硬件平臺。這些平臺的變化速度幾乎與在其上運行的程序一樣快,而且幾乎不能有風險。FPGA的并行處理和靈活性/可重新配置性,似乎與這一需求完全匹配。然而,要使這些設備用于大規模的主流應用,還需要降低加速FPGA架構和配置的設計門檻——這是一個耗時的過程,通常需要高級專業知識。此外,傳統的加速器一般來說細粒度都不夠,并且通常還包含不易擴展的大模型塊。另外,這類設備通常比較耗能,而且往往是獨家制造的,這使得工程師必須重新學習如何利用這類定制平臺。

Sapphire RISC-V內核

利用C/C++即可RISC-V內核上創建應用程序

易靈思通過以直觀的方式克服了AI/ML社區利用FPGA方面的挑戰,從而直接解決了所有這些潛在的障礙。可通過Efinity GUI對RISC-V Sapphire內核進行完全用戶配置。通過這種方式,用戶不必全部知道在FPGA中實現RISC-V背后的所有VHDL,而可以利用通用軟件語言(例如C/C++)的直接可編程性,這使得團隊能夠在軟件中快速生成應用程序和算法。所需的所有外圍設備和總線,都可以與Sapphire內核一起指定、配置和實例化,從而能提供完全可配置的SoC(見圖1)。這種RISC-V功能包括多個內核(最多四核),支持Linux功能,為設計師的FPGA應用程序提供高性能處理器集群,并能夠直接在Linux操作系統上運行應用程序。通過軟硬件分區,下一步的硬件加速被大大簡化。一旦設計師在軟件中完善了算法,就可以在靈活的易靈思FPGA架構中實現穩步加速。不過,在進入下一步的硬件加速之前,重要的是要了解RISC-V架構的固有優勢,以及如何在FPGA架構中充分利用。

圖1:Efinity GUI支持開發人員利用熟悉的編程語言,為完全可配置的SoC配置Sapphire RISC-V內核(左)以及所有所需的外圍設備和總線。此功能可擴展到多達四個RISC-V內核。

支持自定義指令的RISC-V

RISC-V架構的獨特之處在于,它并沒有對所有指令都進行定義,而是預留了一些指令,開放給設計師自定義和實現。換句話說,可以創建一個自定義算術邏輯單元(ALU),當調用自定義指令時,可執行自定義的任意功能(見圖2)。這些自定義指令,將具有與其他指令相同的體系架構(例如,兩個寄存器輸入,一個寄存器輸出),總共支持使用八個字節的有效數據,其中四個字節的數據可以回傳至RISC-V。

然而,由于ALU是在FPGA中構建的,它既可以訪問FPGA,也可以從FPGA中提取數據,從而支持用戶擴展超過8字節的數據,使ALU變得任意復雜,并支持訪問以前送入FPGA上的數據(例如來自傳感器的數據)。當涉及到硬件加速時,這種能力(能夠使ALU任意復雜)則正是速度的倍增因素。易靈思利用了定制指令的這種能力,并通過TinyML平臺將其發布到AI和ML社區。

圖2:可以利用RISC-V創建自定義ALU,其標準配置包括兩個四字節寬的源寄存器(rs1和rs2)和一個四字節寬的目標寄存器(rd)。

TinyML平臺-自定義指令庫

利用TinyML平臺的硬件加速

TinyML平臺簡化了硬件加速過程,其中易靈思采用了TensorFlow Lite模型中所用的計算原語,并創建了自定義指令,使得在FPGA架構中實現的加速器上的執行得以優化(見圖3)。從而將TensorFlow的標準軟件定義模型吸收到了RISC-V復合體中,以硬件速度進行加速,并利用了開源TensorFlow Lite社區的豐富優勢。使用流行的Ashling工具流,簡化了整個開發流程,使設置、應用程序創建和調試過程變得既簡單又直觀。

圖3:TensorFlow Lite模型示意圖。

TensorFlow Lite創建了標準TensorFlow模型的量化版本,并利用函數庫,支持這些模型在邊緣MCU上運行。易靈思 TinyML采用這些TensorFlow Lite模型,并利用RISC-V內核的自定義指令功能,在FPGA硬件中實現加速。

許多TinyML平臺的自定義指令庫,都可供易靈思 GitHub上的開源社區免費訪問,可以訪問設計和開發大幅加速邊緣AI應用所需的易靈思Sapphire內核以及其他任何東西。

加速策略

由于RISC-V內核、易靈思 FPGA架構和豐富的開源TensorFlow社區的有機結合,從而支持創造性的加速策略,這些策略可以分解為幾個步驟(圖4):

步驟1:利用Efinity RISC-V IDE運行TensorFlow Lite模型

步驟2:利用TinyML加速器

步驟3:用戶自定義的指令加速器

步驟4:硬件加速器模板

如上所述,“步驟1”是貫穿Efinity GUI的標準流程,用戶可以利用Tensorflow Lite模型,并在RISC-V上的軟件中運行它,采用的是與標準MCU中相似且設計師非常熟悉的流程,而根本不必擔心VHDL。在步驟1之后,設計師通常會發現,他們正在運行的算法性能不是最優的,因此需要加速。“步驟二”涉及硬件-軟件分區,用戶可以在TensorFlow Lite模型中實現基本構建塊,然后點擊并拖動以實例化自定義指令,并在Sapphire RISC-V內核上對運行中的模型大幅加速。

圖4:易靈思 TinyML平臺的加速策略。

用戶定義的自定義指令加速器

“步驟3”支持設計師在沒有利用TinyML平臺中模板的情況下,創建自己的自定義指令,支持用戶在RISC-V內核上進行創新并實現加速。

硬件加速器模板

最后,所需的基本單元在RISC-V上被加速之后,“步驟4”利用加速“sockets”,將它們掩藏在免許可的易靈思SoC框架中。量子加速器sockets支持用戶“指向”數據、檢索數據、并對內容進行編輯,或者說對更大的數據塊執行卷積運算。

Sapphire SoC可用于執行整體系統控制,并執行固有順序或需要靈活性的算法。如前所述,通過硬件-軟件代碼設計,支持用戶選擇該運算是在RISC-V處理器中執行,還是在硬件中執行。在這種加速方法中,預定義的硬件加速器sockets連接到直接存儲器訪問(DMA)控制器和SoC從接口,用于數據傳輸和CPU控制,也可以用于AI推理之前或之后的預處理/后處理。為了設計中簡化外部存儲器與其他構建塊之間的通信(參見圖5),DMA控制器采用以下方式:

·將數據幀存儲到外部存儲器中

·向硬件加速塊發送數據并從硬件加速塊接收數據

·將數據發送到后處理引擎

在圖像信號處理應用中,這看起來像是讓RISC-V處理器作為嵌入式軟件執行RGB到灰度的轉換,而硬件加速器則在FPGA的流水線以及流式架構中執行Sobel邊緣檢測、二進制侵蝕和二進制擴展。這可以擴展到多攝像頭視覺系統,使開發商能夠快速地將其設計轉化為產品并得以部署。

圖5:采集邊緣視覺SoC架構方框圖。

MediaPipe Face Mesh用例

通過一個例子可以更好地凸顯該流程的簡單性。該例中,MediaPipe Face Mesh ML模型對數百個不同的三維面部標志進行實時估計。易靈思采用了這個模型,并將其部署在Titanium Ti60開發套件上,時鐘頻率為300MHz。在總延遲中,RISC-V內核上的卷積運算所產生的延遲占比最大,如圖6所示。值得注意的是,圖6中所顯示的高達近60%的FPGA資源利用率,實際上并不能反映ML模型的大小。相反,引起的原因是由于整個相機子系統已經在FPGA中實例化,目的是為了使加速度基準測試能夠實時執行。

圖6:在Ti60開發套件上運行MediaPipe Face Mesh預訓練網絡時的延遲和所占資源。

利用TinyML平臺的簡單自定義指令(步驟2)

創建并運行一個簡單的、自定義的兩個寄存器輸入、一個寄存器輸出卷積指令,可以將延遲性能改善四到五倍。隨著用于加速ADD、MAXIMUM和MUL功能的自定義指令的利用,這種改進仍在繼續。然而,由于RISC-V實現這些操作花費時間本身就較少,故延遲改進步入了平穩期(圖7)。

圖7:通過為CONV、ADD、MAXIMUM和MUL函數創建簡單的自定義指令,顯著改善了延遲。

利用DMA的復雜指令(步驟4)

另外還生成了一個任意復雜的ALU來替換原始CONV。這改變了原始曲線的斜率,并再次顯著改進了延遲。然而,由于復雜指令占用了FPGA內部更多資源,FPGA的資源利用率也大幅上升。同樣,資源條顯示也接近100%。其實原因也很簡單,因為這里的FPGA包含了用于演示的整個相機子系統。需要著重注意的是,延遲的相對減少對應的正是資源利用率的增加(圖8)。

更重要的是,如果切換到更大規模的FPGA(如Ti180)來運行所有這些復雜的指令,并進行大規模加速,所用的FPGA資源甚至還不到50%。這些明顯的權衡,讓工程師能夠容易地看到在FPGA的延遲、功耗、成本、以及規模之間的平衡行為。對于具有嚴格延遲要求但功率限制較為寬松的邊緣應用,可以選擇大幅度加速設計,來充分提高性能。而在功率受限的應用中,則可以通過降低時鐘速率,來實現更溫和的性能改進,換取功耗的顯著降低。

 

圖8:利用自定義卷積指令實現加速時的資源消耗示意圖。

圖8中,利用更大的自定義卷積指令來獲得更多的加速,但所消耗的資源急劇增加。請注意,FPGA資源的幾乎全部利用,是因為FPGA包含整個相機子系統,如果Ti60只是運行ML模型,資源利用率將大幅降低。

人工智能/機器學習發展的范式轉變

簡而言之,易靈思結合了熟悉的RISC-V ISA開發環境,并利用其自定義指令功能,在架構靈活的FPGA中發揮作用。與許多硬件加速器不同,這種方法不需要任何第三方工具或編譯器。利用機器指令實現的加速,加速也是細粒度的,而這一級別的粒度,只有FPGA才能實現。

邊緣設備可以原型化,并部署在易靈思FPGA的創新設計架構上,這意味著該解決方案經得起未來考驗。新的模型和更新的網絡架構,可以在熟悉的軟件環境中表達,并且只需少量的VHDL(具有可用模板庫以用于指導),就可以在自定義指令級別上實現加速。這種程度的硬件-軟件分區,其中90%的模型保留在RISC-V上運行的軟件中,從而可以保證非常快的上市時間。

由于所有這些方法的完美結合,導致了一個優異解決方案的產生,從而真正降低了邊緣設備的實現門檻。設計師如今可以利用世界級的嵌入式處理能力,還可以利用最先進的工具流進行訪問,并在革命性的易靈思 Quantum架構上進行實例化。

(參考原文:How Efinix is Conquering the Hurdle of Hardware Acceleration for Devices at the Edge

本文為《電子工程專輯》2023年6月刊雜志文章,版權所有,禁止轉載。點擊申請免費雜志訂閱

責編:Jimmy.zhang
閱讀全文,請先
您可能感興趣
西光貳號01星成功發射,實現“天數天算”技術突破,是中國太空算力布局的重要一步。
東方算芯的探索之所以引人關注,在于其跳出“對標”思路,依托自主可重構近存計算架構與國產化供應鏈,蹚出了一條差異化的創新路徑。
與成立僅七年的Precision Innovations不同,Defacto Technologies成立于2003年,總部位于法國格勒諾布爾,是一家在RTL設計領域深耕二十余年的老牌EDA廠商,專注研發自動化SoC設計創建相關軟件。
美國法院批準Anthropic與作家群體達成15億美元和解協議,這起案件可以為AI時代的知識產權保護帶來哪些啟示?
從增長曲線看,數據中心目前占美國總用電量的5.9%,預計到2030年升至約12%,2035年進一步攀升至20%——不到十年時間,占比擴大逾三倍。
AMD與微軟宣布擴大戰略合作范圍,挑戰英偉達在AI基礎設施領域的統治地位。
“通用處理器”這一術語一直被廣泛用于描述可運行各類軟件工作負載的CPU。在現代基于Arm架構的系統級芯片(SoC)領域,這一稱謂仍被廣泛使用,但隨著系統復雜度不斷提升,我們有必要追問:這類器件在實際應用中,究竟有多“通用”?
隨著AI基礎設施分化為多層專用架構,CPU正成為智能體工作負載的編排層。
本屆WAIC期間,《2026全球AI商業落地價值洞察報告》重磅發布,并在大會的兩大高規格論壇上進行了重點展示。作為大會最受關注的產業研究成果之一,這份報告以“從技術爆發到價值兌現”為主線,系統梳理了全球AI產業的競爭格局與商業落地路徑。 镕銘微電子憑借在VPU賽道上的開創性地位與規模化商業落地能力,成功入選該報告的兩大核心榜單,與全球及國內頂尖科技企業同臺亮相。
NVIDIA?已驗證?ST?的?12?kW?電源傳輸概念驗證板,實際上已進入生產測試階段。
7月22日,在2026中國汽車論壇上,中國汽車工業協會副會長兼秘書長付炳鋒表示,當前全球汽車產業格局深度調整,發展環境更加復雜多變,汽車行業既面臨低碳新規、地緣政治帶來的外部沖擊,也遭受國內競爭加劇、
在5G通信、新能源汽車、人工智能爆發的時代,PCB作為電子產品的 “骨架與神經系統”,正成為剛需中的剛需。2025年PCB工程師崗位需求同比暴漲 53.4%,78%的硬件崗位明確要求掌握PCB設計,懂
專家 訪談PCIe? 6.0時代,重定時器成剛需數據中心解決方案業務部產品市場技術工程師Tam Do(杜澤心)在AI時代,當業界還在為GPU算力的指數級增長歡呼時,一個隱秘的瓶頸正在悄然浮現
點擊藍字 關注我們SUBSCRIBE to USImage Credits:Google谷歌母公司Alphabet正在自研一款全新服務器芯片,用以提升自研大模型Gemini的運行能效。科技媒
7月22日,在2026中國汽車論壇上,零跑汽車董事長、CEO朱江明表示,以增程為代表的插電混動技術不會終結,未來5到10年內,大電量的插電混動汽車在海外市場將是很強勁的產品類型。朱江明指出,這種技術方
韓國無晶圓廠系統半導體公司Global Technology Co., Ltd.(簡稱GT)7月21日宣布,已于20日獲得韓國交易所(KRX)KOSDAQ市場上市預備審查批準,主承銷商為韓國投資證券。
近期,聚燦光電(300708)、創維光顯、鴻佳電子披露產能關鍵節點:聚燦光電紅黃光砷化鎵項目一階段接近滿產,創維光顯武漢基地163英寸Mini LED拼接屏產線滿負荷運行,鴻佳電子鹽城基地二期Mini
算筆賬一批十萬的呆料壓在庫存每月倉儲費?資金成本至少5k放半年就虧3萬有料單不知道怎么推廣?芯片超人已經累計服務2.2萬用戶,打折清庫存,最快半天完成交易!找不到,賣不掉,價格還想再好點,都可以來找我
插播:2026行家說-新世代電源創新技術研討會將于8月25日在深圳舉辦,屆時智光電氣、賽米控丹佛斯、三安半導體、英諾賽科、PI、國聯萬眾、納芯微、創銳光譜等企業將發表最新技術報告,覆蓋800V數據中心
點擊藍字 關注我們SUBSCRIBE to USNavid Anjum Aadit, Xiuqi Zhang, et al.概率計算機未來有望高效處理大量傳統計算機難以攻克的復雜問題,同時還