人形機器人在實驗室主動轉向遮蔽物並以深度感測建立環境模型
鏡子與錘子 Week 04 / 14

會看不等於看懂:機器如何知道自己身在何處?

主動感知、世界模型與不確定性如何引導下一個視線與動作

真正的視覺智能不是把一張照片分類,而是在資訊不完整時決定下一步該看哪裡、走哪裡、如何驗證。主動感知與世界模型把觀看變成服務於行動的連續決策。

每週一篇閱讀計畫 約 10 分鐘閱讀 19 次瀏覽

Direct answer

直接答案

機器要理解未知環境,不能只被動接收相機畫面。它必須估計自己與物體的位置、辨認資訊缺口,再主動移動視角或身體取得新證據。世界模型提供可預測的內部表徵,主動感知則決定下一個最有價值的觀察。

核心命題:視覺不是照片辨識,而是為行動主動取得資訊。

首次發布
最後修改
資料查核基準
2026-07-28
證據層級 已驗證事實 產業趨勢

機器如何在未知世界裡,決定自己該往哪裡看?

想像你第一次走進一間停電的倉庫。

門只開了一條縫。裡面沒有完整地圖,貨架高低不一,地上可能散落著紙箱、推車與纏繞的電線。你不會閉著眼睛直線往前,也不會把視線固定在正中央,等待世界主動把答案送到面前。

你會停一下。

先往左右看,再抬頭確認燈架與貨架的位置;聽見某個方向有聲音,便把身體轉過去;看不清楚紙箱後方是否有路,就往旁邊移半步,換一個角度。你不是只在收集影像,而是在主動製造更有用的影像。

人類把這種能力使用得太自然,以至於很少意識到它是一種智能。

我們不只會看見,也會判斷「現在應該看哪裡」;不只辨識物體,也會透過移動頭部、眼睛與身體,減少不確定性。當環境陌生時,我們先觀測,再行動;行動之後,又利用新的視角修正原本的理解。

對機器人而言,這是一道比物件辨識更深的難題。

攝影機可以拍到畫面,模型也能說出畫面裡有桌子、杯子和門。但一台真正要在未知環境裡工作的機器,必須進一步回答:

  • 哪一個物體與任務有關?
  • 哪一個角度能看見被遮住的部分?
  • 我目前的位置與方向是否判斷正確?
  • 眼前的變化只是光影,還是物體真的移動了?
  • 我做完這個動作後,世界可能會變成什麼樣子?

因此,機器人視覺真正的前沿,不只是把相機做得更清楚,而是讓機器學會主動觀測、建立世界模型,並知道自己還不知道什麼

一、攝影機取得的是畫面,不是世界

一張照片只是某個位置、某個時間、某個角度的投影。

它沒有告訴機器,桌子後面是否還有另一個箱子;也沒有保證看起來像平面的地板真的沒有高低差。物體可能被遮擋,透明與反光材質可能欺騙深度估計,陰影也可能被誤認成障礙。

人類之所以能在不完整畫面中行動,是因為我們會把眼前訊號,和過去經驗、身體運動以及對物理世界的預期結合起來。

當一顆球滾到桌子後方,我們通常不會認為它消失了;當一個人從門邊露出半個身體,我們知道門後可能還有完整的人;當杯子開始傾斜,我們會預期裡面的水可能流出來。

這些判斷都超出了像素本身。

機器人的世界理解也需要相似的層次:

  1. 偵測與辨識:畫面裡有什麼。
  2. 空間理解:它在哪裡、彼此如何排列。
  3. 狀態理解:物體是開著、關著、滿的、空的,還是正在移動。
  4. 因果預測:如果我推、拉、拿起或鬆手,接下來可能發生什麼。
  5. 任務相關性:在目前目標下,哪些資訊值得優先處理。

因此,「看見杯子」與「知道怎麼處理杯子」之間,隔著一整套空間、狀態、物理與任務推理。

這也是為什麼,不能用「人類判斷有百分之八十依賴視覺,而機器視覺不到人類百分之一」這類醒目的比例來概括差距。感官權重會隨任務改變,也沒有一個公認指標能把人類與機器視覺壓成單一百分比。

比較準確的說法是:機器在受控條件下的辨識已非常強,但在開放環境裡,對遮擋、物理狀態、視角選擇、長時間變化與任務關聯的理解,仍然遠不如人類穩定。

二、真正的觀測,是機器主動移動自己的視角

假設桌上有一只袋子,袋口朝向另一邊。

一個被動視覺系統只能分析現有畫面,猜測袋子裡是否有東西;一個具有主動觀測能力的機器,則會理解:目前視角不足以做出可靠判斷,因此應該向左移動、彎低身體,或把袋口輕輕轉過來。

這種能力在研究中常被稱為主動感知或主動視覺。

它的核心不是「多拍幾張照片」,而是把觀測本身納入決策:

下一個動作不一定直接完成任務,也可能只是為了得到更好的資訊。

人類在陌生地方四處觀看,就是最日常的例子。

我們轉頭,不是因為轉頭本身有價值,而是因為新的視角能降低不確定性。機器若要進入倉庫、災區、家庭與戶外,也必須學會這種「先看清楚一點,再決定」的節奏。

截至 2026 年,主動感知已成為具身智能的重要研究方向。新的基準不只測試模型能否回答影像問題,也開始要求它規劃觀測行為:為了找到答案,應該轉向哪裡、靠近什麼、改變什麼視角。2026 年出現的空中具身感知基準甚至把任務拆成高層問題理解、觀測行為規劃與低層飛行控制,結果顯示,即使先進視覺語言模型能描述畫面,對視角調整與閉環任務完成仍然容易失敗。

這個差距很關鍵。

一個模型能對著照片說出「門在左邊」,不等於一台機器能在被貨架遮擋、光線變化與自身晃動的情況下,主動找到那扇門。

三、位置不是一次算出來的,而是持續被修正的

機器人在未知空間裡移動,首先要知道自己在哪裡。

這聽起來簡單,實際上是一個持續修正的問題。輪子可能打滑,雙足行走會產生晃動,相機會因震動模糊,環境裡的物體也可能被人移動。機器若只相信一開始建立的地圖,很快就會在真實世界中迷路。

因此,移動機器人長期使用定位與建圖技術,把攝影機、雷射雷達、慣性測量單元、輪速計或關節狀態融合在一起,一邊移動,一邊估計自身位置並更新地圖。

對具身機器人來說,地圖還不能只是一張幾何平面圖。

它最好同時知道:

  • 哪裡可以走;
  • 哪裡可能碰撞;
  • 哪些物體可以移動;
  • 哪個抽屜可以打開;
  • 哪扇門目前關著;
  • 哪個工作區有人;
  • 哪些區域在任務中具有特殊意義。

這種地圖更接近「可行動的世界模型」。

它不只描述空間,也描述機器與空間之間的關係。桌面不是一片平面,而是可以放置物體的表面;把手不是一個凸起,而是可以拉動門的操作點;雨棚不只是一塊板子,而是在下雨時可能成為避雨位置。

所以當我們說機器能在下雨時主動躲雨,真正涉及的並不是簡單加上一條「偵測到雨就找屋簷」的規則,而是一整串能力:感知環境變化、理解雨水對自身與任務的影響、找出可用遮蔽物、重新規劃路徑,並在不中斷重要任務的情況下做出權衡。

今天的機器在特定場景下可以被設計成做到其中一部分,但距離像人一樣在任意未知環境中自然推理,仍有很大差距。

四、世界模型:在行動以前,先讓未來在內部發生一次

人類端著一杯水經過狹窄走道時,會預先想像某些可能性。

如果轉身太快,水會灑出;如果門正在關閉,手臂可能被夾到;如果前方有人突然停下,必須留出煞車空間。

這種能力不一定以完整畫面出現在意識裡,但我們會對「接下來可能發生什麼」保持某種內部預期。

機器人的世界模型,試圖建立類似能力。

它不是只從目前影像直接輸出動作,而是學習環境的變化規律:物體如何移動、接觸會產生什麼結果、動作是否接近成功,以及失敗之後應該重試還是改變策略。

2025 至 2026 年,多家研究機構開始把世界模型放進機器人資料生成與策略學習。NVIDIA 的 Cosmos 系列利用影片世界模型生成具有物理連續性的合成資料,GR00T 系統則把高層推理與低層動作分開;Google DeepMind 的 Gemini Robotics-ER 1.5 與 1.6,則專門處理空間理解、任務規劃、進度估計與成功偵測,再呼叫 VLA 或其他工具完成動作。

這些架構代表一個重要轉變:

機器人不應只知道下一個動作,還要能判斷任務是否正在朝正確方向前進。

成功偵測尤其重要。

一台機器若把杯子推到桌邊,卻因視角遮擋誤以為已經放好,就可能直接結束任務。更成熟的系統會重新觀察、從其他角度確認,必要時重試。

換句話說,世界模型不只是預測未來,也讓機器有機會檢查自己對現在的理解是否錯了。

五、壓縮感知的真正問題,是「什麼值得看」

原始筆記中把壓縮感知描述成更強的專注視覺,並連結到雙光子顯微成像。這裡需要把兩個概念拆開。

數學與訊號處理中的壓縮感知,是利用訊號的稀疏結構,用少量量測重建資訊;雙光子顯微成像則主要用於生物組織深層成像。它們可以提供技術靈感,卻不是今天機器人主動視覺的直接等同物。

對機器人更實際的問題是:在有限算力、頻寬與時間下,哪些資訊值得被高解析度處理?

一台機器不必對整個房間的每個像素都保持同樣注意力。

當它要插入插頭時,插孔附近的幾毫米最重要;當它在走廊移動時,前方人群與地面障礙比牆上的海報重要;當它聽見異常聲響時,聲音方向可能比原本注視的物體更值得重新觀測。

因此,機器視覺正在從「把所有東西都看得更清楚」,走向「依任務調整注意力、視角與感測精度」。

這和人類仔細觀看的方式相似,但不能被浪漫化為機器已經擁有人類式注意力。今天的注意力機制多半仍由任務目標、模型權重、規則或獎勵函數驅動;它能選擇資訊,不代表它具有主觀關心。

六、不是所有思考都應該送到雲端

早期的具身智能敘事很容易想像一個「雲腦」:機器把感測資料上傳到遠端大型模型,取得指令後再執行。

雲端確實有優勢。它能提供更大的模型、跨機器共享的知識、集中更新與複雜規劃,也適合處理不需要毫秒級反應的任務。

但把所有控制都交給雲端,在現場並不可靠。

網路會延遲,也可能中斷;影像與觸覺資料量巨大;工廠、醫院與家庭還涉及隱私和資安。一個即將跌倒的機器人,不能等待資料送到遠端機房再取得平衡指令;手中的玻璃杯開始滑動時,也不能把高頻觸覺全部上傳後再決定握力。

截至 2026 年,更合理的方向是混合架構:

  • 關節、平衡、碰撞避免與高頻觸覺在機器本地處理;
  • 中階技能由邊緣運算或本地模型執行;
  • 複雜知識查詢、跨任務規劃與群體協調,才視情況使用雲端。

Google DeepMind 在 2025 年推出的 Gemini Robotics On-Device,就是把一般性靈巧操作與快速適應能力放到機器本地執行;2026 年 NVIDIA 的開放參考機器也以 Jetson Thor 提供機上推理與控制。

6G、非地面網路與低軌衛星未來可能支援遠端操作、跨區域協調和偏遠場景連線,但不能因此說大規模衛星建設「主要就是為機器人與自駕車準備」。通訊網路服務的對象遠比機器人廣泛,而安全關鍵控制仍必須具備斷網後的本地能力。

真正成熟的機器,不是擁有一顆無限遙遠的雲腦,而是知道哪些事必須立刻在身體裡完成,哪些事值得向外求助。

七、觀測能力的成熟,會表現在它敢於承認「我還不知道」

人類面對陌生物體時,會靠近、轉動、觸摸,甚至向別人詢問。

這些行為背後有一個共同前提:我們知道目前資訊不夠。

機器人若只會在每個時刻輸出一個看似確定的答案,反而很危險。它可能在看不清楚時仍然伸手,在定位失準時繼續前進,在任務失敗後假裝已經完成。

更可靠的具身系統需要估計不確定性,並把不確定性轉成行動:

  • 換一個角度再看;
  • 靠近一點;
  • 用手輕觸確認;
  • 呼叫其他感測器;
  • 向人詢問;
  • 暫停任務,而不是冒險猜測。

這種能力不像後空翻那樣醒目,卻是機器進入人類空間的基本禮貌。

因為在物理世界裡,錯誤不是一句可以刪除的文字。它可能是一個摔碎的杯子、一件受損零件,甚至是一個被撞傷的人。

會看,只是取得資料。

知道哪裡看不清楚、何時應該停下來,以及下一個觀測如何降低風險,才開始接近理解。

而一旦機器能夠主動觀測、建立世界模型並檢查自身進度,下一個問題自然出現:眼睛、皮膚、地圖、語言和任務規劃產生了這麼多訊號,誰來決定它們之間的優先順序?

那不是一顆更大的單一大腦就能輕易解決的問題。

它需要的是分工。

本章判讀

  • 已驗證事實:主動感知、語意建圖、世界模型、成功偵測與本地推理,都是 2025–2026 年具身智能的重要研究與產品方向。
  • 產業趨勢:機器將採取本地、邊緣與雲端混合運算,而不是所有資料都依賴遠端「雲腦」。
  • 思想框架:「承認不知道」是對可靠具身系統的設計要求,不表示機器具有人的自我反省經驗。

本章參考資料

  1. Google DeepMind, “Gemini Robotics brings AI into the physical world,” 2025. https://deepmind.google/blog/gemini-robotics-brings-ai-into-the-physical-world/
  2. Google DeepMind, “Gemini Robotics 1.5 brings AI agents into the physical world,” 2025. https://deepmind.google/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/
  3. Google DeepMind, “Gemini Robotics-ER 1.6,” 2026. https://deepmind.google/blog/gemini-robotics-er-1-6/
  4. Google DeepMind, “Gemini Robotics On-Device brings AI to local robotic devices,” 2025. https://deepmind.google/blog/gemini-robotics-on-device-brings-ai-to-local-robotic-devices/
  5. NVIDIA, “NVIDIA Releases New Physical AI Models,” 2026. https://investor.nvidia.com/news/press-release-details/2026/NVIDIA-Releases-New-Physical-AI-Models-as-Global-Partners-Unveil-Next-Generation-Robots/default.aspx
  6. Zhang 等,〈ActiveFly-Bench〉,2026 預印本。 https://arxiv.org/abs/2607.10180
  1. 調整全系列 CodeCity Logo 的透明安全邊與左下留白,避免縮圖裁切。
  2. 全系列代表圖左下角加入白色 CodeCity 橫式 Logo。
  3. 加入 Week 1–14 每週閱讀節奏,統一全系列代表圖與作者署名。
  4. 依發行閱讀版母稿 v0.9 完成首次公開發布與資料查核。

讀者留言

還沒有留言

歡迎成為第一個分享觀點的人

發表留言

聯絡地址
8 F., No. 279, Sec. 4, Xinyi Rd., Da’an Dist., Taipei City 106439, Taiwan (R.O.C.)
電子郵件
Email:codecity0912@gmail.com
CodeCity 品牌 Logo
© 2023 CodeCity Inc. All rights reserved.