回到智慧機器人 18 篇策展
智慧機器人研究 · EP04 · 模型與資料

具身智慧真正缺的不是模型,而是能反覆學習的真實世界資料

高品質遙操作資料一筆曾超過 8 元人民幣,模型卻可能需要千萬小時級訓練;資料閉環才是機器人最深的護城河。

>8 元傳統資料成本高品質遙操作單筆曾超過人民幣 8 元
3–5 元改善後區間產業創新壓低的單筆平均成本
千萬小時級模型需求業界對高品質模型訓練資料量的估計
DATA FLYWHEEL

資料越貴,越需要從真實部署把它賺回來

成本從每筆超過 8 元降到 3–5 元,與千萬小時級需求仍有巨大落差。

1真實部署從高頻任務取得感知、動作與結果
2失敗分類保留接管、滑落、繞路與未知情境
3模型迭代用高價值資料修正,而非堆重複樣本
4再部署確認成功率提升並擴大相鄰任務

資料來源與口徑:人民幣/筆與時數需求依白皮書第 15 頁;千萬小時為報告引述的業界估計。

語言資料很多,物理互動資料很少

網路上有海量文字、圖片與影片,能訓練模型回答『怎麼把杯子放進洗碗機』;但影片不會提供每一瞬間的夾爪力量、關節角度、物件滑動與失敗原因。機器人要真正學會工作,需要把感知、動作、力回饋與任務結果對齊。這類資料昂貴、難標註、容易受設備差異影響,也常包含人臉、聲音、工廠機密與空間資訊。

成本只是第一個瓶頸

白皮書指出,傳統遙操作蒐集的高品質實景資料,單筆成本曾超過人民幣 8 元,產業創新正把平均壓到 3 至 5 元。但即使每筆更便宜,模型可能需要千萬小時級資料,而成熟公開資料集只有數十萬小時,供需仍差一個數量級。更重要的是,資料量大不代表有效;重複、簡單或缺乏失敗標記的資料,可能只讓模型更會表演已知動作。

真正的飛輪從部署開始

頭部服務機器人廠商因為已有大量設備在餐廳、飯店、商場與工廠長時間運作,能累積導航、避障、交付與異常紀錄。每一次卡住、繞路、人工接管,都是模型下一輪改善的素材。這形成『部署更多—取得更多真實資料—模型更穩—更容易部署』的飛輪。新創若只有實驗室資料,就算模型論文亮眼,也很難追上數年的營運累積。

不要先蓋資料湖,先定義值得學的失敗

企業導入時應先找高頻、可量測、可安全介入的場景,明確定義成功、失敗與人工接管。每筆資料都要保留設備版本、場域、任務、結果與權限來源,才能重現問題。資料治理也必須從第一天設計,包括個資遮罩、工廠機密分級、保存期限與跨境限制,否則收得越多,法律負債也越大。

模型像學生,場景像學校;沒有每天真實作業、批改與重考,再聰明的學生也只會考古題。

資料護城河的三個檢查點

第一,資料是否來自真實任務而不是大量重複模擬;第二,是否包含長尾失敗與人工修正;第三,改善後能否快速送回現場驗證。具身智慧不是一次訓練完成的產品,而是一套持續營運的學習系統。能把閉環轉快、轉便宜、又合法的公司,才可能建立長期差異。

模擬資料很重要,但不能獨自結案

模擬能快速產生罕見狀況、降低真人操作成本,也能在不傷害設備與人的情況下訓練策略;網路影片則提供物件與動作先驗。但材質摩擦、鏡面反射、機構鬆動與人類不可預測行為,仍需要真實世界校正。好的資料策略不是選擇模擬或實景,而是先用便宜資料建立能力,再用高價真實資料針對落差修正。

長尾失敗比平均成功更有價值

若一萬次任務有九千九百次相同成功,新增資料的邊際價值很低;真正影響商業化的,是剩下一百次:透明物件、突發人流、感測器髒污、網路中斷、夾持滑落。企業應建立失敗分類與優先級,讓每次人工接管都能回答『為何失敗、如何重現、哪一層要改』。沒有失敗資料,模型只會變得更有自信,不一定更可靠。

資料權利會決定飛輪歸誰

設備部署在客戶現場,產生的影像、動作與工藝資料究竟屬於客戶、整機廠還是模型商,合約必須先定義。供應商若不能合法用資料改進產品,飛輪轉不起來;客戶若無法限制敏感資訊外流,也不會開放。可採分級授權、去識別、只回傳特徵或在地訓練,讓商業價值與機密保護取得平衡。


資料來源與閱讀邊界

本文以 普華永道《2026 年智能機器人產業發展白皮書》2026-07)第 9、15、16 頁為主軸,並以官方公開資料補充。圖表由 XMY 重新繪製;金額、時間與市場數據須留意報告口徑、預測假設及四捨五入。

白皮書是資料起點,不是本站結論;台灣機會與經營建議為編輯延伸判讀。本文不構成投資、交易、採購或法律建議。

這是「2026 智慧機器人產業拆解」第 4 篇。整套策展只追一個問題:機器人何時從展示走向能長期、可靠、值得付費的工作?