【導讀】云端AI時代已然落幕,邊緣AI憑借低延時、高隱私、低成本的核心優勢,成為人工智能落地實體設備、融入工業與生活場景的核心趨勢。當下邊緣AI的發展瓶頸,早已不再是模型訓練能力,而是設備實時推理的硬件適配問題。本文結合意法半導體資深技術專家深度訪談,拆解邊緣AI從云端走向終端的產業底層邏輯,詳解芯片內存架構從傳統馮·諾依曼架構到存內計算的迭代路徑,分享意法半導體在存內計算領域的十年技術沉淀與量產落地成果,并剖析物理AI、嵌入式AI及機器人產業的共性技術難題,揭秘前沿硬件架構從實驗室技術走向商業化量產的完整落地路徑。
本文與 ST專家Giuseppe Desoli 探討了以內存為中心的芯片設計、存內計算,以及在人工智能真正融入微控制器、傳感器或機器人靈巧手之前,芯片硬件層面需要做出哪些方面的改變。

Giuseppe Desoli博士
意法半導體公司院士、首席創新官,系統研究與應用事業部總經理兼部門副總裁
AI曾經是運行在云端的。為什么它必須走向邊緣端?
Giuseppe Desoli博士:因為產業經濟邏輯已經發生改變。多年來,AI 最大的難點在于模型訓練。雖然訓練成本高昂,但是模型訓練僅需要在數據中心訓練一次,訓練好后的模型是可以多次反復使用的。
當下的形勢已然不同。我們正看到系統需要連續推理并且需要持續感知并反應的物理實體系統。在這兩類場景下,主要的消耗不再是模型訓練,而是推理決策,即 AI 實際做出決策的時刻,推理運算發生在數據被創建的時候。
在看到這一點后,邊緣 AI 的現實價值就不言而喻。那些需要毫秒級響應的設備根本無法等到數據往返于云端和本地。家庭內部設備也不應該需要把視頻數據向外傳輸到云端。并且,如果傳感器數量達到成百上億個,并讓每個傳感器都依賴遠程計算,那么推理成本將高得令人難以承受。
因此,延時、隱私和成本三大因素全都指向同一個方向:人工智能必須發生在數據產生時,靠近執行器,并貼近現實世界環境。
您將這一重要趨勢概括為“從存儲向計算轉移”。落實到工程實踐層面,這該如何理解?
Giuseppe Desoli博士:在神經網絡當中,數據搬運所消耗的能耗,往往遠高于運算本身。因此,真正的設計考量,不只是計算單元的算力有多強,而是數據需要移動多遠的距離。
我們可以將這一轉變概括為四個階段。首先是經典的馮·諾依曼架構,處理器與存儲器分開獨立存在,數據在兩者之間來回傳輸。第二階段是近存儲計算:將內存與處理單元集成到同一顆芯片上。該方案能夠減少數據搬運,同時提升帶寬。第三階段是基于 SRAM 的存內計算。在該架構下,核心數學運算直接在存儲陣列內部完成。第四階段是非易失性存內計算。在此架構內,同一個高密度存儲器陣列既用于存儲模型參數,又用于執行計算,無需移動模型中的權重數據。
這才是真正的變革。內存不僅是存放數據的容器,本身也是計算單元的一部分。該理念正是我們架構選型的核心。存內計算的測試芯片至關重要,僅靠仿真模擬是遠遠不夠的。一套架構只有真正直面硅片現實層面的各類問題,才算真正落地;這些現實問題包括器件工藝偏差、特性漂移、制造良率,以及編譯器配套支持。
意法半導體如今在存內計算研究項目的進展如何?
Giuseppe Desoli博士:我們已經完成存內計算的流片驗證,并且開展相關工作已經很多年。在ISSCC 2023(第70屆IEEE國際固態電路會議) 上我們展示了一種基于18nm FD SOI的全數據存內計算加速器方案。在 4 比特精度下,該樣片的能達到40310?TOPS/W的計算效率。最重要的并不是這個性能數字,而是隱藏在數字背后的工程能力。
首先,該設計采用多瓦片架構,這意味著其高能效并不局限于單個實驗室模塊,而是擴展到尺寸更大的、更具備實用價值的加速器。其次,這是數字架構。它可以輸出準確、可復現的運算結果,并且能夠走標準化芯片設計、測試以及產品開發流程,這一點也使該樣片適合實際芯片制造。
這一成果并非一蹴而就,是多年技術積累的結果。最早可以追溯到2017年流片驗證的早期硅樣片,之后完成平臺與軟件工具鏈開發,讓架構具備可編程的能力。這條技術路線最終催生了 NeuralART 系列 NPU 加速器,其中第一代就搭載在意法半導體首款內置硬件 AI 加速器的 STM32微控制器STM32N6 上。
在ST,存內計算的前沿研究與產品規劃并非相互脫節,而是持續近十年的長期研發項目。
物理 AI,嵌入式AI,機器人產業,面臨不同的問題還是同一問題?
Giuseppe Desoli博士:它們彼此高度相關,但是因為時機至關重要,挑戰變得更難。物理 AI 系統必須實時持續感知,理解、決策、行動。要想在一個瞬息萬變、不可預測的環境內正常完成這個閉環,必須依靠高速本地推理,不能過度依賴數據發到云端,然后等待云端應答。
這個改變也是邊緣計算可以做到的。這類系統需要在設備端感知場景,融合不同傳感器的數據,保護數據隱私,并且必要時,支持類似生物反射一般的瞬時響應。
這也是機器人技術正在發生變革的原因之一。早期機器人系統往往依靠精心編寫的規則執行特定的任務,基于規則的解決方案在可控環境中效果良好,但在情況瞬息萬變的現實世界中,表現就會大打折扣并且差強人意。
因此,可以取而代之的是一種集成度更高的一體化方法,用一個模型將感知、推理和控制三個環節更直接地連接起來,使機器能夠更輕松地處理新對象和不熟悉的任務。
同時,模型本身也在持續演進,正朝著產生平順性和連續性更好的運動軌跡的方向發展。這對于實體設備而言是利好,因為電機與執行機構需要平滑、高頻更新的控制信號才能良好工作。
加上人工智能模型的需求與邊緣設備的能力之間的差距正在不斷縮小,這意味著邊緣AI已經貌似一個現實可行的設計目標,而不再是遙不可及的構想。
這正是以內存為核心的架構設計發揮關鍵作用之處。這類系統必須持續感知不斷變化的外部環境,同時實時決策。因此,場景感知能力是不能后期打補丁,而是從設計之初就走好存算協同之路。
探索性前沿架構如何轉化為客戶可采購的量產產品?
Giuseppe Desoli博士:主要是通過工具完成產品轉化。新硬件如果不能被開發者實際使用,則算不上產品。因此,每一代加速器也都有配套的適配通用開發流程的編譯器和量化工具。
其中就包括ST Edge AI邊緣 AI 工具和STM32 AI 生態。開發者從標準學習框架導出訓練好的神經網絡模型,再將其導入ST Edge AI邊緣 AI工具內,轉換為可在目標設備運行的代碼。
我們大量對外發表的研究成果,恰恰集中在這一關注度低卻不可或缺的層面:將神經網絡映射到硬件模塊,并探索模型層與層之間的編譯優化。
部分研發工作是采取產學研開放式協作模式。我們與多所高校、蘇黎世 IBM 研究院保持長期合作關系,最近我們還與新加坡國立大學建立了一個企業聯合實驗室。
以內存為中心的計算技術覆蓋面廣泛,意義重大,僅一家企單獨行動是無法搞定的。對于決定今后十年發展方向的課題,目前在各類學術會議上仍存爭議,尚無定論。
結論
未來十年邊緣 AI 的競爭核心不再是算力堆砌,而是**內存架構革新**。產業重心已由云端訓練轉向邊緣實時推理,延遲、隱私與規模化成本,正推動 AI 算力全面下沉至終端場景。傳統馮?諾依曼架構因數據搬運開銷大、響應慢,難以滿足物理 AI、機器人、智能傳感的實時閉環需求。行業演進明確指向**存算一體化架構**,通過存儲與計算融合,從硬件底層提升推理效率、降低能耗,支撐終端高頻、平滑的感知與控制能力。
存內計算的商業化落地,依賴長期工藝迭代、硬件驗證、軟件工具鏈與生態協同。意法半導體憑借多年技術積累與產學研合作,完成了前沿架構從研發到量產的完整落地。整體來看,存算一體將成為驅動邊緣 AI、嵌入式與機器人產業升級的核心抓手,未來行業迭代與市場競爭將圍繞**內存架構優化、軟硬件協同、開放生態共建**持續展開。




