空中巴士(Airbus)高階副總裁Greg Ombach於富比士科技委員會發表專文指出,當前實體AI(Physical AI)所仰賴的視覺—語言—動作模型(VLA)正面臨嚴峻的規模化擴展矛盾(Scaling Trade-off)。模型越大,雖然能力越廣,但運算量與機器人資料需求呈指數級暴增,根本無法部署於邊緣裝置;若改採輕量化模型,雖然能在本機運行,卻難以跨機器、跨任務轉移已學會的技能,每次環境變動都必須重新訓練與驗證。
當前VLAs主要依賴二維像素特徵(Visual Tokens)進行推論,再反推三維空間結構,效率極低且缺乏物理直覺。Ombach主張必須走向模組化架構:將語義理解、空間幾何、動力學預測與任務決策徹底分離。這套架構強調以「幾何優先(Geometry-First)」的模型提取表面、邊緣、形狀與運動等可重複利用特徵,並結合力量、接觸與物理動力學,使機器人能預判動作後果。時間關鍵的控制迴路必須在邊緣硬體上以毫秒級延遲運行,徹底擺脫對雲端連線的依賴。此外,文中揭露其親身經歷:汽車電池產線自動化程度高達80%至90%,但航太業因零件多達數百萬、設計優先考量飛機性能,自動化程度僅20%至30%,點出實體AI必須從「邊界明確的工業任務」逐步擴展至醫療與家庭的務實路徑。
本文本質並非傳統地緣政治或商業利益角力的零和博弈,而是聚焦於人工智慧技術典範轉移的結構性技術矛盾。因此,本文將跳過陰謀論式的利益剖析,轉而深入探討VLA架構為何走向死胡同,以及模組化設計如何成為下一代機器人技術的必然演化路徑。
傳統VLA模型承襲自大型語言模型(LLM)的「單體巨型網路」思維,試圖用海量資料與龐大參數吞噬所有感知、推理與控制任務。然而,這條路徑在實體世界撞上了三道物理高牆:
這場技術演進的核心矛盾,在於「雲端集中式智慧」與「邊緣即時性需求」的根本撕裂。自駕車領域的發展已提供殷鑑:即便有道路、標線、地圖與法規的強約束,其商業化部署仍只能從高速公路逐步擴展至限定區域,最後才逐步擴大地理範圍。相比之下,通用機器人面對的是工業廠房、醫院與家庭中截然不同的物件、工具、力量與安全條件,複雜度遠超自駕車。
破局的技術共識正在浮現:將AI模型與安全機制徹底解耦。Ombach明確警告,安全絕不能依賴AI模型本身,必須設有獨立的安全護欄可隨時減速或停機。同時,模組化讓語言理解與車隊學習可在雲端運行,但時間關鍵的空間狀態與動作決策必須在邊緣獨立完成,這正是「十五分鐘學習」願景的架構基礎。
戰略貿易流向與供應鏈依賴度
HS 8507資料來源:UN Comtrade 聯合國商品貿易統計庫 · 全球市場規模 $1,300 億美元 / 年 (複合成長率 >24%)
對照汽車工業從80%至90%自動化到航太業僅20%至30%自動化的巨大鴻溝,實體AI的規模化勢必經歷一段痛苦的「逐域驗證」過程。以下預測未來三至七年可能演進的三種情境:
面對實體AI從「展示型科技」走向「規模化基礎建設」的關鍵轉折期,產業領袖與投資人應採取以下雙軌佈局:
01 起因觸發:VLA單體模型在邊緣部署面臨算力、能耗與延遲三重物理高牆,規模化矛盾全面引爆
02 一階傳導:邊緣AI晶片設計商、幾何視覺感測器與輕量化推論引擎供應商迎來訂單爆發期
03 二階擴散:航太、汽車與精密製造大廠(如Airbus)開始重構採購規格,要求供應商具備技能遷移能力
04 宏觀終局:實體AI作業系統新典範成形,重塑全球高階製造、長照與家庭服務的勞動力結構與成本曲線
因果網路圖譜 1 節點
可拖曳節點 · 點兩下開啟文章