先看結論:企業買的不是模型,而是完成工作的能力
直覺上模型愈強,外部控制似乎可以愈少;但當 Agent 從單輪問答進入多步驟、跨系統與長時間任務,Harness 的重要性反而上升。任務鏈愈長,單一步驟的小錯愈可能在後續被放大;權限愈高,一次錯誤工具呼叫的損失也愈大。報告提到 Codex 單次任務已可持續六小時以上,這時最大的問題不再是能不能生成程式,而是狀態、驗證與人類品質檢查能否跟上。
這個題目值得獨立拆解,因為企業 AI 已經走到第二個階段。第一階段比的是模型能不能回答,第二階段比的是系統能不能在資料不完整、權限複雜、流程跨部門的環境裡,穩定交付可衡量結果。Agent 愈強,為何 Harness 反而愈重要?六小時任務會把小錯放大不是技術名詞的排列組合,而是一個組織、工程與財務必須同時成立的問題。
運作機制:把人的經驗翻成 Agent 可執行的規則
長任務需要保存已完成項目、未決風險、環境狀態與產出物,並在任務脈絡壓縮或新的工作階段繼續。Harness 透過計畫、檔案記憶、檢查點、測試、日誌與評估器,把任務切成可以驗證的片段;若偏離目標,可以在局部回復而不是整段重來。當 Agent 能操作瀏覽器、程式庫或企業系統時,還要為每個工具設定範圍、核准與資源上限。
Harness 可以理解為包在模型外面的 Agent 執行環境。它管理任務脈絡、記憶、工具、狀態、權限、驗證、監控與錯誤復原,把一次文字生成變成可以持續做事的系統。模型像大腦,Harness 更像神經、手腳、安全帶與行車紀錄器;少一樣,正式上路都會讓法務和資訊長睡不好。
實務上應先畫出原有流程的輸入、判斷、工具、輸出與例外,再決定哪些環節交給 Agent、哪些需要人工核准。這個順序很重要:若先拿模型找題目,團隊容易做出技術可行但商業低頻的功能;若先找出高成本、高等待或高錯誤的流程,再設計資料與執行環境,投資報酬率才有機會被驗證。
財務視角:從專案收入走向能力複製
長時間自主執行會降低人類直接操作工時,但也可能把成本轉移到模型呼叫、等待、重試與品質保證。若團隊只看『Agent 工作六小時』,卻忽略其中四小時在循環重試,節省只是幻覺。應將有效進度、失敗後回復時間、人工審查量與基礎設施成本一起計算。當程式生成吞吐上升,人類審查若成為瓶頸,Harness 必須把更多自動測試與驗證前移。
財務長應把成本拆成五層:場景診斷、資料與系統串接、模型推論、執行框架、上線後的人工作業。初期毛利偏低不必然代表模式失敗,因為第一批客戶可能同時支付產品學習成本;但下一批同類客戶若沒有明顯縮短交付週期,代表知識沒有資產化。最重要的曲線,是每一元新增收入需要多少新增工程人力與模型成本。
收入品質也要分開看。一次性顧問費能證明客戶願意付錢,訂閱與用量收入則更能反映系統已進入日常流程;成果分成若能建立清楚基線,可能提高上限,但也會帶來歸因與合約爭議。健康的商業組合通常是以前期服務完成導入,再讓軟體、技能模組與執行量成為後續擴張主體。
執行方法:從一個高價值流程開始
複雜任務可設三層護欄:開始前有清楚計畫與資源限制,執行中有檢查點、工具權限與異常偵測,完成後有獨立測試與結果比對。對不可逆操作,如付款、刪除資料或正式發布,必須保留人工核准。把所有步驟都要求人點擊會失去自動化價值,把所有權限一次打開則是在請事故寫企劃書。
導入時應先定義成功與失敗。成功不只包含平均任務時間下降,也包括錯誤率、人工覆核、法遵事件與使用者採用;失敗則要能被分成模型、資料、權限、工具、流程或組織責任。分類清楚後,每次錯誤才會變成測試資料與產品改進,而不是群組裡又多一張『AI 怎麼又壞了』的截圖。
反方論證:重交付也可能只是昂貴的人力生意
更強模型確實可能接手部分規劃、摘要與簡單自我修正,部分舊有 Harness 元件會變得多餘。Anthropic 的經驗也顯示,模型升級後可以刪除某些工作分段與評估器。正確結論不是 Harness 永遠愈厚愈好,而是要隨模型能力重新測試每個元件;留下模型仍無法穩定完成的控制,移除只增加成本的裝飾。
最複雜的 Harness 不一定最好。每多一個規劃器、評估器或子 Agent,都會增加模型呼叫、延遲與故障點。合理做法是以真實任務做刪減測試:拿掉元件後成功率是否下降、下降多少、值不值得額外成本。最終要最佳化的是每個成功任務的總成本,而不是單次 Token 最便宜。
此外,報告整理的數據包含企業調查、公司案例、產品公告與研究判斷,可信度與時間點並不完全相同。本文保留原始頁碼,並把已發生事實、廠商所述規畫與延伸分析分開呈現。對快速變動的 Agent 市場而言,最危險的不是判斷暫時錯,而是把尚未驗證的規畫寫成已經實現的財務成果。
台灣企業可以怎麼用:先做流程資產負債表
台灣企業若從客服、程式開發或文件流程進入長任務 Agent,應先建立任務分級。低風險工作可以較高自主,高風險工作則限制工具、資料與最終動作。資安、法遵與內稽不應只在上線前簽字,而要共同設計日誌、人工接管與事故演練,讓治理成為執行環境的一部分。
接下來可固定追蹤:1、長任務有效進度比例;2、循環與狀態漂移發生率;3、人工品質檢查時間;4、高風險工具的核准與回復機制。這些指標同時涵蓋技術、流程與財務,能避免團隊只挑對自己有利的數字。對台灣企業而言,最務實的起點通常不是成立一支龐大 AI 部門,而是選一條跨資料、跨系統、又能直接衡量成本或營收的流程,讓小型 FDE 團隊與業務負責人共同完成第一個生產閉環。
最後要記住,真正的護城河不是 Prompt 數量,而是企業願不願意把規則、失敗案例與決策邊界持續沉澱。模型會升級、單價會下降、工具名稱也會換季;留在公司裡的本體模型、測試資料集、連接器、技能模組、權限設計與營運紀錄,才是能在下一輪技術變化中繼續複利的資產。
任務時間拉長,控制需求同步上升
長任務常見風險與控制
| 風險 | 表現 | Harness 控制 |
|---|---|---|
| 狀態漂移 | 忘記已完成事項 | 檢查點、檔案記憶 |
| 工具誤用 | 操作錯系統或範圍 | 權限、核准、沙箱 |
| 錯誤累積 | 前一步錯、後面全錯 | 分段驗證、局部回復 |
| 人類瓶頸 | 產出多、審查跟不上 | 自動測試、風險分級 |
資料來源與策展方法
- 國泰海通證券《FDE 與 Harness 推動 AI 商業化導入》,第9頁:長時間 Agent、錯誤累積、Codex 六小時任務、人類 QA 成為瓶頸
本站未刊載原始券商報告圖片,而是依報告數據重新繪圖、整理表格,再加入 XMY 的商業、財務與經營框架。公司案例與規畫不等於已實現的普遍結果,仍應依最新官方資料與實際專案驗證。