機器人靈巧手以觸覺與力覺控制抓取易變形紙杯
鏡子與錘子 Week 03 / 14

指尖的宇宙:為什麼一個紙杯比語言模型更難?

觸覺、力覺與閉環控制如何決定機器人能不能真正操作世界

人手拿起紙杯時,會同時感受接觸、滑動、形變與重量,並在幾十毫秒內修正力道。對機器人來說,這不是單次辨識,而是感知與動作不斷互相校正的閉環控制問題。

每週一篇閱讀計畫 約 9 分鐘閱讀 198 次瀏覽

Direct answer

直接答案

紙杯比文字問題更難,因為它會在接觸中變形、滑動甚至破裂。機器人必須即時融合視覺、觸覺、力矩與本體感覺,持續調整抓力;只會辨識物體或生成動作序列,還不足以可靠操作真實世界。

核心命題:真實智能必須在接觸、滑動與形變中閉環控制。

首次發布
最後修改
資料查核基準
2026-07-28
證據層級 已驗證事實 產業趨勢

為什麼一個紙杯,比語言模型更難?

請拿起一個空紙杯。

不要想,只要做。

你的手會自然地靠近杯壁,拇指與其他手指在兩側形成支撐。杯子很輕,所以你幾乎不需要用力。接著,把水慢慢倒進去。隨著重量增加,你的手指會在沒有命令的情況下,自動多收緊一點。水在杯中晃動,重心不停改變,你的手腕與手臂也跟著做出微小修正。

如果杯壁沾到水,摩擦變小,你會更警覺;如果旁邊有人碰你一下,你可能先握緊,再把手臂往身體靠;如果紙杯開始變形,你又會立刻放鬆,避免把它捏扁。

整個過程也許只有幾秒鐘。

你沒有求解方程式,沒有在腦中估計摩擦係數,更沒有逐條命令每一塊肌肉。但在這幾秒裡,你的視覺、觸覺、力覺、前庭系統、本體感覺和多年經驗,已經完成了大量閉環修正。

這就是具身智能最容易被低估的地方。

語言模型可以在幾秒內寫出一篇關於「如何拿紙杯」的完整說明,真正的機器手卻可能在第一次接觸時,把紙杯捏扁、讓它滑落,或在水量增加後來不及調整。

它不是不知道杯子是什麼。

它是不知道自己正在怎樣碰它。

一、看見杯子,只完成了任務的前半段

電腦視覺的進步,讓機器能辨認杯子、估計位置、建立三維輪廓,甚至理解「請把半杯水拿到桌上」這句話的語意。

但視覺只能提供部分答案。

杯壁到底有多軟?手指和表面之間是否正在滑動?杯子內部的重量是否突然增加?抓取點是否偏離重心?這些資訊有時能從畫面猜測,卻無法只靠畫面可靠取得。

尤其當接觸位置被手掌遮住,或物體內部狀態不可見時,機器必須依賴觸覺與力覺。

力覺回答的是:「我用了多少力?」

觸覺回答的則更接近:「這個力落在哪裡?表面正在滑嗎?物體是否變形?接觸是否穩定?」

兩者都不是裝飾性的附加感官,而是把動作從開環命令變成閉環控制的關鍵。

沒有它們,機器只能按照事先算好的軌跡伸手;有了它們,它才有機會在世界偏離預期時修正自己。

二、手指不只是感測器,也是計算的一部分

人類的手並不是一組感測器,加上一組馬達那麼簡單。

肌腱的彈性、手指的形狀、皮膚的摩擦、關節的限制與物體本身的變形,會共同分擔控制工作。當我們握住一個形狀不規則的物體時,手掌與手指會在一定程度上被動貼合,不需要大腦逐一計算每個接觸點。

這種「把計算藏進身體」的概念,在機器人學中常被稱為形態計算或具身計算。

2026 年《Nature Communications》一篇關於軟體機器人物理計算的觀點文章,指出材料、結構與控制器可以共同承擔資訊處理;一個設計良好的柔性結構,本身就能吸收衝擊、適應形狀,減少中央控制器必須即時處理的負擔。

這也是為什麼,更靈巧的手不一定等於更多馬達。

關節越多,理論上可做的姿態越多;但致動器、線纜、熱量、重量、故障點與控制維度也一起增加。2025 年發表、2026 年刊出的 Tactile SoftHand-A,只使用少量致動器與欠驅動結構,配合指尖觸覺,就能處理柔性杯子在重量突然變化時的抓取修正。

它的啟示不是「少馬達一定比較好」,而是:真正的靈巧,來自機械結構、感測與控制的共同設計。

如果身體本身願意幫忙,大腦就不必處理所有細節。

三、滑動往往比掉落早一步發生

人類拿東西時,不會等到杯子真的掉下去才反應。

在物體明顯位移以前,指尖已經能察覺很小的剪切力、震動與局部滑移。這些訊號讓神經系統提前增加握力,阻止掉落發生。

機器人若要擁有相似能力,就必須把接觸事件的感測速度提高到足夠快,並讓低層控制迴路能直接反應。

截至 2026 年,研究者正在嘗試多種觸覺來源:以相機觀察柔性表面變形的視覺式觸覺、壓力陣列、應變感測、聲學訊號、震動訊號,甚至把不同訊號融合成統一的觸覺表徵。

2025 年提出的 Sparsh-X,使用約一百萬次接觸互動,結合影像、聲音、動作與壓力等觸覺模態,試圖讓模型不只辨識「碰到了什麼」,還能推斷材料、力道與物體狀態。2026 年的 TouchWorld 預印本則更進一步,把觸覺分成兩個時間尺度:高層用來預測接觸目標,低層用來快速修正滑動、偏移與力道不匹配。

這和人的控制方式非常接近。

我們不會讓深思熟慮的大腦皮層,獨自處理每一個即將滑落的杯子。快速、局部的修正必須在更靠近身體的層級完成。

因此,「讓手部晶片自適應抓取,減少大腦運算」這個想法有合理方向,但更精確的表述應該是:把高頻接觸控制下放到本地低層迴路,讓高層模型專注在任務與策略。

它不是手指完全不需要大腦,而是不同問題應該在不同時間尺度上解決。

四、紙杯之後,真正的地獄是布料

如果紙杯是一道考題,那麼床單、毛巾與衣服更像一整張無法預先列完答案的試卷。

剛體物件的形狀大致固定。杯子無論放在哪裡,仍然是一個杯子;機器可以估計它的姿態,決定抓取位置,再規劃運動軌跡。

布料卻不同。

同一件上衣被隨手丟在床上,可以形成幾乎無窮多種摺疊、遮擋與纏繞狀態。機器抓住一個衣角,整件衣服的形狀就會改變;拉錯方向,原本平整的地方會產生新的皺褶;兩層布貼在一起時,視覺甚至可能分不清它們是否已經分離。

這就是柔性操作困難的原因:動作不是在一個固定世界裡發生,動作本身會立刻改寫世界。

2025 至 2026 年,Google DeepMind、LG、SwitchBot 與多家新創都展示了分類、折疊或堆放衣物的系統;學術界也在推進長鏈雙手操作與未見物件泛化。但「展示過一次」與「在陌生家庭裡每天可靠完成」仍然不是同一件事。

柔性操作的成功不能只看一段最好看的影片,而應追問:衣服是否來自訓練集?房間是否陌生?摺疊標準如何定義?失敗是否需要遠端人員接管?一百件不同材質的衣服,成功率和平均時間是多少?

這些問題看起來掃興,卻是把研究進展與市場宣傳分開的必要條件。

五、雙手協作不是多一隻手,而是多一個關係

單手抓取主要處理一條動作鏈。

雙手操作則引入了相互依賴:一隻手固定物體,另一隻手旋轉;一隻手把袋口撐開,另一隻手放入物品;左手拋出小沙包,右手必須預測方向、速度與落點,再決定何時接住。

當兩台機器人互相傳接物體時,問題又增加一層。它們不只要理解物體,還要理解彼此的意圖、可達範圍與動作時機。

截至 2026 年,雙手模仿學習與跨物件泛化進展很快。AAAI 2026 的研究展示了從人類示範學習大量雙手技能,也有工作主張只用一次示範,就能把部分技能結構轉移到語意相近的新物件與不同機器平台。

但雙手真正的價值,不在於表演更像人,而在於它能把「抓取」升級成「操作」。

搬箱子、鋪床單、裝配、插接、開袋、使用工具,很多任務都需要兩個末端執行器形成動態分工。當機器能讓一隻手替另一隻手創造條件,它才開始接近人類工作的組織方式。

六、昂貴感測器教出來的能力,能不能住進便宜機器?

你的原始筆記裡有一個非常重要的想法:訓練時使用更精密、更昂貴的感測器收集資料,最後把能力蒸餾到感測較粗糙、成本較低的量產機器上。

這條路確實符合產業邏輯。

研究設備可以裝滿高解析度觸覺、力矩感測器、動作捕捉與外部相機;工廠產品則必須面對成本、耐用度、清潔、校準與維修。消費級產品更不可能讓每一個指節都使用實驗室等級的感測器。

因此,未來很可能形成三層資料鏈:高規格設備負責建立最精細的真實資料;工業平台用較便宜的感測器完成特定場景的再訓練與校正;消費級產品則依靠已經學到的表徵、少量本地感測與軟體更新執行任務。

但這並不是把資料「不斷粗糙化」那麼簡單。

當感測器被拿掉,模型失去的不只是解析度,還可能是某種關鍵物理訊號。如果量產機器完全看不見滑動,訓練資料再精細也無法憑空創造當下的接觸資訊。

真正可行的是找出最小充分感測:哪些訊號必須保留在本地?哪些細節可以由模型估計?哪些高昂感測只需要在訓練階段出現?

你可以把量產機器想成一個有點近視的學徒。

老師曾經看得非常清楚,因此教會它哪些線索最重要;但學徒仍然必須保有足夠的視力,才不會在真正工作時把杯子摔碎。

七、機器人怎麼學會游泳?它終究得碰到水

模擬是機器人學習的重要工具。

在虛擬世界裡,機器可以跌倒一百萬次而不會摔壞;研究者能改變重力、摩擦、材質、光線與物體位置,在短時間內產生大量訓練情境。

但模擬永遠是世界的壓縮版本。

水的流動、布料的皺褶、橡膠的回彈、線纜的纏繞、零件磨損後的微小間隙,很難被完全建模。當虛擬環境與真實世界的差距太大,機器在模擬裡學到的完美動作,到了現場就可能立即失效。

所以機器人怎麼學會游泳?答案不是只把水模擬得更漂亮,而是終究要讓它下水。

它必須在真實接觸中經歷質量、密度、彈性、重力、阻力、碰撞、運動自由度、可破碎性、抓取點與狀態變化。模擬負責讓它用低成本學會大致方向,真實世界則負責指出模型遺漏了什麼。

2025 年以後,越來越多系統採取模擬與真實資料共同訓練、世界模型生成合成軌跡、再用少量實體示範校正的方式。這不是因為模擬失敗,而是因為真正成熟的具身智能,必須同時利用兩個世界:在虛擬世界大量犯錯,在物理世界學會敬畏。

八、真正讓機器落地的,可能不是更大的腦,而是更誠實的皮膚

我們這個時代很容易崇拜「大腦」。

模型參數、推理能力、語言理解與世界知識,都能被做成醒目的排行榜。但在工廠、廚房、病房與家庭裡,最後一公分的成敗經常發生在指尖。

機器能不能在物體開始滑動時提早反應?能不能根據水量增加調整握力?能不能分辨布料已經拉平,還是只是把皺褶推到另一邊?能不能在旁人碰撞時保持穩定,又不因過度用力傷害人?

這些問題很少有一句驚人的答案。

它們需要更耐用的感測器、更低延遲的控制、更好的機械順應性、更大量的接觸資料,以及對失敗的精細定義。

語言讓機器知道任務是什麼;觸覺則讓它知道,世界沒有完全按照語言描述的方式存在。

當機器的手終於開始感覺,下一個問題便不再是它能否碰到世界,而是:這麼多來自眼睛、皮膚、關節與任務的訊號,究竟該由誰指揮?

那會把我們帶到下一個層次——機器如何看、如何選擇注意力,以及如何在未知環境裡建立一個可以行動的世界。

本章判讀

  • 已驗證事實:觸覺與力覺能提升滑動偵測、柔性杯抓取與接觸豐富任務的穩定性;多模態觸覺與雙手操作是活躍研究方向。
  • 產業趨勢:高規格資料採集、模擬訓練與低成本部署會形成分層硬體與資料鏈。
  • 思想框架:「更誠實的皮膚」指的是物理回饋的重要性,不代表觸覺比所有其他技術都重要。

本章參考資料

  1. Li 等,〈Tactile SoftHand-A: 3D-printed, tactile, highly underactuated, anthropomorphic robot hand with an antagonistic tendon mechanism〉,《International Journal of Robotics Research》,2025/2026。 https://doi.org/10.1177/02783649251379516
  2. Higuera 等,〈Tactile Beyond Pixels: Multisensory Touch Representations for Robot Manipulation〉,2025。 https://arxiv.org/abs/2506.14754
  3. Zhou 等,〈TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation〉,2026 預印本。 https://arxiv.org/abs/2607.07287
  4. Hao 等,〈TLA: Tactile-Language-Action Model for Contact-Rich Manipulation〉,2025。 https://arxiv.org/abs/2503.08548
  5. Zhang 等,〈VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation〉,2025。 https://arxiv.org/abs/2505.09577
  6. Wang 等,〈Embodying physical computing into soft robots〉,《Nature Communications》,2026。 https://doi.org/10.1038/s41467-026-70866-6
  7. Google DeepMind, “Gemini Robotics 1.5,” 2025。 https://deepmind.google/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/
  8. LG Electronics, “LG Electronics Presents LG CLOiD Home Robot to Demonstrate ‘Zero Labor Home’ at CES 2026,” 2026。 https://www.lg.com/global/newsroom/news/home-appliance-solution/lg-electronics-presents-lg-cloid-home-robot-to-demonstrate-zero-labor-home-at-ces-2026/
  9. Bi 等,〈H-RDT: Human Manipulation Enhanced Bimanual Robotic Manipulation〉,AAAI 2026。 https://doi.org/10.1609/aaai.v40i22.38875
  1. 調整全系列 CodeCity Logo 的透明安全邊與左下留白,避免縮圖裁切。
  2. 全系列代表圖左下角加入白色 CodeCity 橫式 Logo。
  3. 加入 Week 1–14 每週閱讀節奏,統一全系列代表圖與作者署名。
  4. 依發行閱讀版母稿 v0.9 完成首次公開發布與資料查核。

讀者留言

1 則
m
meilleur casino en ligne 3 months ago

Bien vu sur le blackjack numérique et ses possibilités chez les débutants. Cependant trop imaginent que technique égale profit sûr, ce qui provoque regret.

發表留言

聯絡地址
8 F., No. 279, Sec. 4, Xinyi Rd., Da’an Dist., Taipei City 106439, Taiwan (R.O.C.)
電子郵件
Email:codecity0912@gmail.com
CodeCity 品牌 Logo
© 2023 CodeCity Inc. All rights reserved.