回到 FDE × Harness 20 篇策展
ENTERPRISE AI · EP 08 · Harness 讓 Agent 可靠執行

Agent 愈強,為何 Harness 反而愈重要?六小時任務會把小錯放大

多步驟、跨系統、長時間與高權限任務,使狀態漂移、工具誤用與錯誤累積成為系統風險。

先看結論:企業買的不是模型,而是完成工作的能力

直覺上模型愈強,外部控制似乎可以愈少;但當 Agent 從單輪問答進入多步驟、跨系統與長時間任務,Harness 的重要性反而上升。任務鏈愈長,單一步驟的小錯愈可能在後續被放大;權限愈高,一次錯誤工具呼叫的損失也愈大。報告提到 Codex 單次任務已可持續六小時以上,這時最大的問題不再是能不能生成程式,而是狀態、驗證與人類品質檢查能否跟上。

這個題目值得獨立拆解,因為企業 AI 已經走到第二個階段。第一階段比的是模型能不能回答,第二階段比的是系統能不能在資料不完整、權限複雜、流程跨部門的環境裡,穩定交付可衡量結果。Agent 愈強,為何 Harness 反而愈重要?六小時任務會把小錯放大不是技術名詞的排列組合,而是一個組織、工程與財務必須同時成立的問題。

運作機制:把人的經驗翻成 Agent 可執行的規則

長任務需要保存已完成項目、未決風險、環境狀態與產出物,並在任務脈絡壓縮或新的工作階段繼續。Harness 透過計畫、檔案記憶、檢查點、測試、日誌與評估器,把任務切成可以驗證的片段;若偏離目標,可以在局部回復而不是整段重來。當 Agent 能操作瀏覽器、程式庫或企業系統時,還要為每個工具設定範圍、核准與資源上限。

Harness 可以理解為包在模型外面的 Agent 執行環境。它管理任務脈絡、記憶、工具、狀態、權限、驗證、監控與錯誤復原,把一次文字生成變成可以持續做事的系統。模型像大腦,Harness 更像神經、手腳、安全帶與行車紀錄器;少一樣,正式上路都會讓法務和資訊長睡不好。

實務上應先畫出原有流程的輸入、判斷、工具、輸出與例外,再決定哪些環節交給 Agent、哪些需要人工核准。這個順序很重要:若先拿模型找題目,團隊容易做出技術可行但商業低頻的功能;若先找出高成本、高等待或高錯誤的流程,再設計資料與執行環境,投資報酬率才有機會被驗證。

財務視角:從專案收入走向能力複製

長時間自主執行會降低人類直接操作工時,但也可能把成本轉移到模型呼叫、等待、重試與品質保證。若團隊只看『Agent 工作六小時』,卻忽略其中四小時在循環重試,節省只是幻覺。應將有效進度、失敗後回復時間、人工審查量與基礎設施成本一起計算。當程式生成吞吐上升,人類審查若成為瓶頸,Harness 必須把更多自動測試與驗證前移。

財務長應把成本拆成五層:場景診斷、資料與系統串接、模型推論、執行框架、上線後的人工作業。初期毛利偏低不必然代表模式失敗,因為第一批客戶可能同時支付產品學習成本;但下一批同類客戶若沒有明顯縮短交付週期,代表知識沒有資產化。最重要的曲線,是每一元新增收入需要多少新增工程人力與模型成本。

收入品質也要分開看。一次性顧問費能證明客戶願意付錢,訂閱與用量收入則更能反映系統已進入日常流程;成果分成若能建立清楚基線,可能提高上限,但也會帶來歸因與合約爭議。健康的商業組合通常是以前期服務完成導入,再讓軟體、技能模組與執行量成為後續擴張主體。

執行方法:從一個高價值流程開始

複雜任務可設三層護欄:開始前有清楚計畫與資源限制,執行中有檢查點、工具權限與異常偵測,完成後有獨立測試與結果比對。對不可逆操作,如付款、刪除資料或正式發布,必須保留人工核准。把所有步驟都要求人點擊會失去自動化價值,把所有權限一次打開則是在請事故寫企劃書。

導入時應先定義成功與失敗。成功不只包含平均任務時間下降,也包括錯誤率、人工覆核、法遵事件與使用者採用;失敗則要能被分成模型、資料、權限、工具、流程或組織責任。分類清楚後,每次錯誤才會變成測試資料與產品改進,而不是群組裡又多一張『AI 怎麼又壞了』的截圖。

反方論證:重交付也可能只是昂貴的人力生意

更強模型確實可能接手部分規劃、摘要與簡單自我修正,部分舊有 Harness 元件會變得多餘。Anthropic 的經驗也顯示,模型升級後可以刪除某些工作分段與評估器。正確結論不是 Harness 永遠愈厚愈好,而是要隨模型能力重新測試每個元件;留下模型仍無法穩定完成的控制,移除只增加成本的裝飾。

最複雜的 Harness 不一定最好。每多一個規劃器、評估器或子 Agent,都會增加模型呼叫、延遲與故障點。合理做法是以真實任務做刪減測試:拿掉元件後成功率是否下降、下降多少、值不值得額外成本。最終要最佳化的是每個成功任務的總成本,而不是單次 Token 最便宜。

此外,報告整理的數據包含企業調查、公司案例、產品公告與研究判斷,可信度與時間點並不完全相同。本文保留原始頁碼,並把已發生事實、廠商所述規畫與延伸分析分開呈現。對快速變動的 Agent 市場而言,最危險的不是判斷暫時錯,而是把尚未驗證的規畫寫成已經實現的財務成果。

台灣企業可以怎麼用:先做流程資產負債表

台灣企業若從客服、程式開發或文件流程進入長任務 Agent,應先建立任務分級。低風險工作可以較高自主,高風險工作則限制工具、資料與最終動作。資安、法遵與內稽不應只在上線前簽字,而要共同設計日誌、人工接管與事故演練,讓治理成為執行環境的一部分。

接下來可固定追蹤:1、長任務有效進度比例;2、循環與狀態漂移發生率;3、人工品質檢查時間;4、高風險工具的核准與回復機制。這些指標同時涵蓋技術、流程與財務,能避免團隊只挑對自己有利的數字。對台灣企業而言,最務實的起點通常不是成立一支龐大 AI 部門,而是選一條跨資料、跨系統、又能直接衡量成本或營收的流程,讓小型 FDE 團隊與業務負責人共同完成第一個生產閉環。

最後要記住,真正的護城河不是 Prompt 數量,而是企業願不願意把規則、失敗案例與決策邊界持續沉澱。模型會升級、單價會下降、工具名稱也會換季;留在公司裡的本體模型、測試資料集、連接器、技能模組、權限設計與營運紀錄,才是能在下一輪技術變化中繼續複利的資產。

XMY ORIGINAL VISUAL

任務時間拉長,控制需求同步上升

相對風險示意
圖表由 XMY 依報告數據與架構重新繪製;並列指標僅呈現原始口徑,不將不同單位直接比較。公司案例、規畫與預測不等於必然實現的結果。

長任務常見風險與控制

風險表現Harness 控制
狀態漂移忘記已完成事項檢查點、檔案記憶
工具誤用操作錯系統或範圍權限、核准、沙箱
錯誤累積前一步錯、後面全錯分段驗證、局部回復
人類瓶頸產出多、審查跟不上自動測試、風險分級
SOURCES & METHOD

資料來源與策展方法

  • 國泰海通證券《FDE 與 Harness 推動 AI 商業化導入》第9頁長時間 Agent、錯誤累積、Codex 六小時任務、人類 QA 成為瓶頸

本站未刊載原始券商報告圖片,而是依報告數據重新繪圖、整理表格,再加入 XMY 的商業、財務與經營框架。公司案例與規畫不等於已實現的普遍結果,仍應依最新官方資料與實際專案驗證。

風險提醒:企業 AI 仍受客戶預算、資料治理、組織採用、模型成本、技術路線與競爭變化影響。本文僅供研究與教育,不構成證券買賣、採購或法律建議。模型可以很有自信,投資人最好保留計算機。