Nvidia ASPIRE 是什麼?機器人技能庫如何改寫具身智能訓練範式
2026 年 7 月 1 日,輝達開源 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),機器人任務失敗後,系統自動分析感知、規劃、抓取哪層出問題,把修復經驗寫進持續擴充的技能庫
目錄

重點摘要
- 2026 年 7 月 1 日,輝達開源 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration),機器人任務失敗後,系統自動分析感知、規劃、抓取哪層出問題,把修復經驗寫進持續擴充的技能庫
- ASPIRE 建立在 Code as Policy 之上,補上兩個長期缺口:失敗後歸因不清(系統只知道「任務沒完成」),以及每次修好的方案任務結束就丟掉、下次碰到類似問題從零重試
- 輝達機器人部門主管 Jim Fan 稱訓練產物從浮點權重轉為持續積累的技能庫,代表一種新的訓練框架;但此系統的泛化能力尚待第三方複現驗證
2026 年 7 月 1 日,輝達開源了機器人技能學習框架 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration)。這套系統讓機器人在執行任務失敗後,透過分析多模態執行軌跡找出問題根源,把修好的程式邏輯沉澱成可持續調用的技能。輝達機器人部門主管 Jim Fan 指出,ASPIRE 背後是一套與過去不同的持續學習框架:訓練從梯度下降轉向技能打磨(Skill Refinement),訓練產物從浮點權重變成機器人能持續擴充的感知動作技能庫(Sensorimotor Skills Library),分散式訓練則變成多個 agent 各自練習不同技能,再把經驗匯進同一個技能庫。
Code as Policy 的哪兩個洞被補上了?
要理解 ASPIRE 在做什麼,先要知道 Code as Policy 是一條怎樣的路線,以及它卡在哪裡。
Code as Policy 的核心想法直接:與其讓模型輸出動作序列,不如讓大型語言模型寫出可執行的機器人控制程式,程式裡直接呼叫感知模組、路徑規劃 API、機械臂控制原語。機器人行為從此不再藏在神經網路的權重裡,而是寫成可讀、可改、可除錯的程式碼。有了程式碼,現在能力強悍的 agent 模型就能介入,負責檢查、修改、除錯、繼續優化。
但這條路線長期有兩個問題。第一,機器人任務失敗後,系統通常只回報「任務未完成」,說不清是感知辨識錯了、路徑規劃的目標點落在碰撞緩衝區內,還是抓取動作本身沒執行到位。沒有清楚的歸因,coding agent 很難有效修改程式。第二,就算這次成功除錯,修復方案在任務結束後直接丟棄,下次遇到同類問題,整個除錯流程要重來。ASPIRE 把這兩個缺口正面補上:詳細的執行軌跡解決歸因,沉澱到技能庫的修復經驗解決記憶。
ASPIRE 的三段流水線怎麼跑?
ASPIRE 的架構分三段。
第一段是執行引擎(robot execution engine)。機器人嘗試任務時,每一次感知呼叫、規劃呼叫、抓取動作都留下完整的輸入、輸出、視覺證據與錯誤日誌。以一個具體例子說明:機器人要拿起收音機,已辨識到目標卻一直無法靠近,執行引擎的紀錄讓後端的 GPT / Claude 得以推論出問題根源,路徑規劃器給的目標點全部落在障礙物的碰撞緩衝區內,不是辨識出錯。
第二段是技能庫(skill library)。agent 修好程式並驗證通過後,這次的修復邏輯被整理成一條可複用的技能條目,例如「規劃失敗時,從 45°、90°、180° 等不同角度重新接近目標,直到找到無碰撞路徑」。技能庫裡的條目是人類可讀的,更像機器人工程師的踩坑筆記,涵蓋 SAM3 文字提示的寫法、桌邊物體的多角度接近策略、抽屜把手的假偵測過濾方法等具體模式。下次遇到類似場景,不管目標換成微波爐還是其他家具,都能直接調用。
第三段是演化搜尋(evolutionary search)。系統同時生成多條候選控制程式,讓它們進執行環境競跑,再根據存活程式和失敗軌跡繼續迭代。這相當於在機器人程式迭代過程中加入 A/B 測試,增加每輪除錯找到有效方案的機率。
「訓練產物是技能庫」這個轉向,對做具身 AI 的團隊意味著什麼?
Jim Fan 說,當機器人完成第 100 個任務時,它終於不再像完成第 1 個任務那樣一無所知。這句話指向一個值得認真對待的架構方向:持續學習的累積單位,正從連續的浮點空間(模型權重)移向離散的、可驗證的技能條目。
這個方向與近期 agent 工程社群討論的 skill / tool library 主線高度重疊。coding agent 迴圈在軟體工程領域已經成熟,業界開始把同樣的持續學習機制搬進物理世界,ASPIRE 是目前看到的一個比較系統性的嘗試。技能庫條目人類可讀,可以被審查、手動修正、甚至跨機器人平台遷移。理論上,多個機器人 agent 分頭練習不同技能、再匯入同一個技能庫的分散式訓練架構也因此變得可行,因為技能條目是顯式的、可合併的,而不像模型權重需要複雜的融合策略。
不過,Jim Fan 稱「訓練的框架已經改變」,目前仍是其個人判斷。ASPIRE 的論文結果是否能在家電操作以外的場景普遍化,或在不同機器人硬體平台上穩定複現,仍需第三方驗證。做具身 AI 的團隊若要跟進,合理的切入點是把 ASPIRE 當成一個值得實測的架構假說,而非已成立的通用真理。
ASPIRE 之所以站得住腳,前提是 Code as Policy 把機器人行為外顯成可讀的程式碼。ASPIRE 再往前一步,讓除錯過程產生的修復知識有地方落地,而不是每次消散。對正在設計具身 agent 架構或機器人自動化流程的團隊,這件事提出了一個具體問題:你的系統有沒有對應的「記憶基礎設施」,讓每次失敗沉澱成資產,而不是回到起點的訊號?
標籤


