機器能不能看一段影片,就學會新的動作?
一個孩子第一次看見大人摺毛巾,不需要知道「布料狀態估計」或「雙手軌跡最佳化」。
他看著大人抓住兩個角,把毛巾攤平、對折,再用手掌壓一下。第一次模仿時,邊角可能歪掉;第二次,他會試著拉平;做過幾次之後,即使換一條不同顏色、不同大小的毛巾,也大致知道該怎麼開始。
這種學習能力對人類太普通了。
我們可以從示範中抽出動作結構,再把它套到不完全相同的物體與環境。看別人投球,不會只記住那一顆球的像素位置;學會端盤子,也不需要為每一種盤子重新訓練一個大腦。
機器人長期缺少的,正是這種能力。
傳統工業機械臂能非常精確地重複一段軌跡,但托盤尺寸改變、物體位置移動或光線不同,都可能需要工程師重新校正。它完成的是被定義好的程序,而不是抽象技能。
具身智能希望跨過這條界線:
- 在一個盤子上學會端取,換形狀與重量仍能完成;
- 看過人類整理桌面,能把相似結構轉移到另一個房間;
- 從影片、示範、模擬與少量真實資料中,學會未被逐步編程的新行為;
- 面對失敗與變化時,不必整套模型從頭再訓練。
這些能力常被統稱為泛化與通用性,但兩個詞其實不完全相同。
一、泛化不是會更多,而是能把學過的帶到沒見過的地方
泛化可以從幾個層次理解。
1. 物體泛化
機器學會抓一只白色馬克杯後,能不能抓不同顏色、尺寸、把手方向與材質的杯子?
2. 場景泛化
在實驗室桌面上學會的整理能力,能不能搬到另一張桌子、不同光線與背景雜物中?
3. 任務泛化
學會「拿起」「打開」「放入」之後,能不能把這些能力重新組合,完成未直接示範過的長任務?
4. 身體泛化
同一套模型能不能從雙臂機械平台,遷移到不同尺寸、不同關節與不同末端執行器的機器?
5. 擾動泛化
有人碰撞、物件移位、抓取失敗後,能不能恢復,而不是整段程序崩潰?
因此,「端盤子不在意形狀大小與重量」是一個好的泛化例子,但不代表機器真的完全不在意這些條件。
恰好相反,它必須感知形狀、重量與重心,再把學到的原則調整到新條件。泛化不是忽略差異,而是知道哪些差異需要改變動作,哪些差異不影響任務本質。
二、通用性不是不必訓練,而是訓練不再只服務單一答案
「通用機器人可以做人類能做的事情,而且不需要重新訓練」是一個有吸引力的終極想像,但截至 2026 年,還不是現實描述。
今天最先進的通用模型仍需要大量預訓練、示範、模擬、後訓練與場景校正。它們可以比傳統系統更快適應新任務,卻不代表完全不需要新資料。
真正的進步,是適應成本正在下降。
過去,一個新任務可能需要工程師重新寫規則、標註大量軌跡;現在,模型可以利用已有世界知識、跨任務表示與少量示範,在較短時間內建立新技能。
Google DeepMind 的 Gemini Robotics 強調跨任務與跨機器形態的遷移;NVIDIA 的 GR00T 系列則以通用基礎模型加上後訓練,適配不同人形機器與工作;Figure 的 Helix 也以單一 VLA 系統控制多種家庭與物流行為。
這些系統仍不是一台「看一次就永遠學會」的全能機器。
更準確的比喻,是一個受過廣泛基礎教育的學徒。它不必為每件事從字母開始學習,但進入新工種時,仍需要示範、練習與安全驗證。
三、為什麼人類影片如此誘人?
機器人資料昂貴。
要收集一段高品質機器示範,通常需要遠端操作設備、動作捕捉、相機、感測器與人員。機器還可能跌倒、碰撞或損壞。即使一段動作成功,也只代表某一具身體在某個場景中做過一次。
相較之下,網路上存在難以計數的人類活動影片。
人會做飯、整理房間、修理設備、跳舞、運動、操作工具。第一人稱影片還能提供「人當時看到什麼」,第三人稱影片則能呈現全身姿態與環境互動。
如果機器能從這些影片學習,資料規模將不再只取決於工程師遙控了多少小時。
這也是「給機器看 YouTube,它就能學跳舞」這個想像的來源。
方向並非全然虛構。2025 至 2026 年,越來越多研究嘗試把人類影片轉成機器可用的動作監督。Figure 的 Project Go-Big 宣布使用大規模第一人稱人類影片預訓練 Helix,並展示從人類影片遷移到機器導航;NVIDIA 的 EgoScale 使用超過兩萬小時帶動作標籤的第一人稱影片,研究人類資料規模與靈巧操作學習的關係;HumanX、ZeroWBC 與 Human-as-Humanoid 等 2026 年研究,則嘗試把人類動作重新映射到 Unitree G1 或高自由度人形上。
但影片不是現成的機器指令。
四、人類和機器,並沒有同一副身體
一個人從影片中看懂舞蹈,是因為觀看者與表演者共享相似的身體結構。
機器不一定如此。
人類手腕的活動範圍、肌肉彈性、腳掌形狀與重心位置,都和機器不同。影片還不會直接提供馬達扭矩、關節電流、觸覺或精確三維軌跡。鏡頭角度、遮擋與剪輯,也可能讓關鍵動作消失。
因此,從影片學習通常需要幾個轉換:
- 從影像估計人體姿態與物體狀態;
- 理解動作的目標,而不是只複製外觀;
- 把人類動作重新映射到機器關節;
- 在模擬中檢查平衡、碰撞與可行性;
- 用真實機器控制器追蹤動作;
- 透過感測回饋修正影片中不存在的物理差異。
所以,給一台機器播放一段 YouTube 影片,通常不會讓它立刻獲得可安全執行的技能。
比較可行的路線,是影片提供高層結構與動作先驗,再由人體動作恢復、重定向、世界模型、模擬與少量真實資料,把它翻譯成機器能執行的策略。
HumanX 在 2026 年展示從單段人類影片學到傳球、籃球與互動動作,再零樣本轉移到實體 Unitree G1;但這依賴完整的資料生成與模仿學習框架,並不是機器單純「看懂影片」。
這個差別很重要。
媒體可以說機器從一段影片學會動作,工程上則應說:系統以人類影片為起點,經過姿態估計、資料增強、動作重定向與控制學習,產生可部署技能。
五、模仿外形,不等於理解目的
假設影片裡的人伸手把一只杯子往右移。
他可能是在整理桌面,也可能是在避免杯子被碰倒,或只是為了拿到後面的手機。如果機器只學動作軌跡,便可能在錯誤情境中重複同一個動作。
真正的技能需要理解目標。
跳舞可以主要模仿全身姿態;整理房間卻需要判斷什麼算整齊、物品屬於哪裡、哪些東西不能丟。做飯更涉及食材狀態、溫度、安全與文化習慣。
因此,從影片學習要從「像人一樣動」走向「知道人為什麼這樣動」。
語言標註、任務描述、世界模型與結果評估,都在補足影片的語意。模型不只預測下一個姿勢,也要判斷完成條件。
Figure 的 Project Go-Big 使用自然語言指令連結人類影片與導航;NVIDIA 的人類影片轉移方法,也用視覺語言表示協助模型把人類行為和機器任務對齊。這些方向正在縮短模仿與目的之間的距離,但距離真正理解仍然很遠。
一台機器可以學會把枕頭放回床上,不代表它理解睡眠、舒適或家的意義。它學到的是可用的行為結構,而不是人類生活經驗的全部內涵。
六、合成資料:在虛擬世界裡,把一次示範變成一千種變化
真實資料昂貴,影片又缺少完整動作訊號,因此世界模型與模擬成為資料放大器。
NVIDIA 在 2025 年提出 DreamGen,先讓影片世界模型學習特定機器的外觀與動態,再生成所謂神經軌跡,將少量遙控資料擴張成不同動作與環境。公開結果顯示,研究團隊只以一項抓放任務的遙控資料為起點,生成資料後讓人形機器學習二十二種新行為。
GR00T N1 的資料藍圖也展示,把少量人類示範轉換成數十萬條合成軌跡,再和真實資料共同訓練。
這種方法的吸引力很明顯:
- 不必讓人類逐次遙控每一種變化;
- 可以隨機改變物體、背景、光線與位置;
- 危險失敗先在模擬裡發生;
- 不同身體可以共享部分高層資料。
但合成資料也可能放大錯誤。
世界模型若沒有學到正確摩擦、材料變形或碰撞,生成的軌跡看起來合理,實際上卻不可執行。資料量增加不一定等於物理真實性增加。
所以合成資料最適合扮演「擴大可能性」的角色,最後仍需要真實世界驗證。
七、雙手協作:從自己的左右手,到另一台機器
人類雙手經常扮演不同角色。
一手固定物體,另一手操作;一手拋出沙包,另一手預測方向並接住;兩個人一起摺床單時,還要從對方的動作推測何時拉緊、何時放鬆。
這些任務把泛化、觀測、預測與協作集中在一起。
對單一機器而言,左右手需要共享全身狀態。拋接小沙包不是背誦固定軌跡,而是根據每次飛行方向與速度調整接取位置。兩台機器互傳物體,還必須估計對方意圖、時間與可達範圍。
2026 年 Figure 展示兩台 Helix 02 在臥室共同整理與鋪床。依公司說法,它們沒有中央共享規劃器或直接訊息傳遞,而是各自從視覺中推測夥伴意圖。這是令人注意的公司展示,但不應直接被當成已經證明通用多人協作。
真正的挑戰在於:
- 換一張更大或更滑的床單,是否仍能完成?
- 其中一台抓錯位置時,另一台能否補救?
- 人類突然加入或打斷,系統是否安全?
- 成功率、速度與維修成本是否足以進入真實工作?
泛化的價值,只有在這些變化裡才能被看見。
八、魯棒性:真正的泛化要包括失敗後回來
一個模型在全新物體上成功一次,常被稱為零樣本泛化。
但工業與家庭真正需要的,不只是第一次猜對,而是失敗後能恢復。
有人撞到機器、托盤晃動、物體滑落、門突然關上,系統應該重新定位、評估風險,再決定繼續、重試、改用另一種技能或求助。
這種能力通常被稱為魯棒性、恢復能力或閉環適應。
它比泛化到新顏色更難,因為失敗會把世界帶進訓練資料較少見的狀態。杯子掉了一半、布料纏在關節上、箱子卡在貨架邊緣,都不是乾淨的初始條件。
因此,成熟的具身系統需要刻意蒐集失敗資料,而不是只保存漂亮的成功示範。
真正通用的機器,不能只知道理想情況下怎麼做;它還要知道事情已經不理想時,怎麼安全地回來。
九、從「看一遍就會」到「看一遍就知道如何開始學」
人類也不是所有事情看一次就會。
看過外科手術影片,不代表能替人開刀;看過游泳,也不代表下水不會溺水。模仿能力建立在身體經驗、反覆練習、回饋與社會指導上。
因此,對機器更合理的期待,不是任何影片都能瞬間轉化為完美技能,而是:
影片讓它知道任務大致長什麼樣子,已有基礎模型讓它理解物體與動作,模擬讓它先大量試錯,少量真實資料再把能力校正到具體身體。
這已經是一個非常大的改變。
傳統機器必須等工程師逐步編程;下一代機器可能只需要人類示範一次,再由系統主動提出需要補充的資料、在模擬中練習,最後由人確認安全。
「看一遍就會」仍是誇張的標語。
「看一遍就知道如何開始學」,則正在逐漸成為工程現實。
當機器可以從人類、影片、模擬與其他機器汲取技能,產業的下一個瓶頸就不再只是一台機器學得多快,而是這些不同品牌、不同身體與不同控制系統,能不能交換能力、共享狀態並一起工作。
那會把我們帶到一座反向的巴別塔。
本章判讀
- 已驗證事實:人類影片、模擬、世界模型與少量真實示範,已能協助機器學習新行為與跨物體、環境或身體泛化。
- 產業趨勢:資料來源將從昂貴遙控,擴張到第一人稱影片、合成軌跡與跨機器共享表示。
- 思想框架:「看一遍就知道如何開始學」比「看一遍就完全學會」更接近 2026 年的技術現況。
本章參考資料
- Figure, “Project Go-Big,” 2025. https://www.figure.ai/news/project-go-big
- NVIDIA, “EgoScale,” 2026. https://research.nvidia.com/labs/gear/egoscale/
- NVIDIA, “DreamGen,” 2025. https://research.nvidia.com/labs/gear/dreamgen/
- Wang 等,〈HumanX〉,2026 預印本。 https://arxiv.org/abs/2602.02473
- Yang 等,〈ZeroWBC〉,2026 預印本。 https://arxiv.org/abs/2603.09170
- Lin 等,〈Human-as-Humanoid〉,2026 預印本。 https://arxiv.org/abs/2606.32009
- Figure, “Helix 02 Bedroom Tidy,” 2026. https://www.figure.ai/news/helix-02-bedroom-tidy