先看結論:企業買的不是模型,而是完成工作的能力
早期 Agent Harness 多由開發者預先寫好提示、步驟與錯誤處理,本質是靜態工作流程。這對規則明確的任務有效,卻難以涵蓋現實環境的所有失敗。報告引用 Harness-R1 研究指出,固定 Self-Refine 在三個基準測試中反而讓 Reward 下降,而不同環境需要不同介入位置。下一代 Harness 的方向,不是堆更多固定規則,而是從真實失敗軌跡判斷何時、在哪裡、用什麼方式修正執行。
這個題目值得獨立拆解,因為企業 AI 已經走到第二個階段。第一階段比的是模型能不能回答,第二階段比的是系統能不能在資料不完整、權限複雜、流程跨部門的環境裡,穩定交付可衡量結果。從靜態流程到自我演進:Harness 如何利用失敗軌跡改寫自己不是技術名詞的排列組合,而是一個組織、工程與財務必須同時成立的問題。
運作機制:把人的經驗翻成 Agent 可執行的規則
自我演進的核心資料是完整 Trajectory:模型看到的脈絡、採取的動作、工具回應、環境變化、失敗原因與最後結果。系統先辨識失敗模式,再修改提示、工具選擇、記憶策略、動作前檢查或回饋後復原,最後以相同任務集重新評估。某些購物任務更需要動作前媒合,某些環境任務則更依賴取得回饋後復原,說明介入點必須依任務而變。
Harness 可以理解為包在模型外面的 Agent 執行環境。它管理任務脈絡、記憶、工具、狀態、權限、驗證、監控與錯誤復原,把一次文字生成變成可以持續做事的系統。模型像大腦,Harness 更像神經、手腳、安全帶與行車紀錄器;少一樣,正式上路都會讓法務和資訊長睡不好。
實務上應先畫出原有流程的輸入、判斷、工具、輸出與例外,再決定哪些環節交給 Agent、哪些需要人工核准。這個順序很重要:若先拿模型找題目,團隊容易做出技術可行但商業低頻的功能;若先找出高成本、高等待或高錯誤的流程,再設計資料與執行環境,投資報酬率才有機會被驗證。
財務視角:從專案收入走向能力複製
自我演進可以降低人工作業與重複除錯,但也帶來評估成本。每次修改 Harness 都要用固定資料集、真實流量影子測試與版本控管,避免在一類任務變好、另一類任務退化。若沒有可靠評測,『自我改善』很可能只是把問題移到看不見的角落。財務上應比較失敗率下降所節省的人工與重試,是否大於額外訓練、評估與運算成本。
財務長應把成本拆成五層:場景診斷、資料與系統串接、模型推論、執行框架、上線後的人工作業。初期毛利偏低不必然代表模式失敗,因為第一批客戶可能同時支付產品學習成本;但下一批同類客戶若沒有明顯縮短交付週期,代表知識沒有資產化。最重要的曲線,是每一元新增收入需要多少新增工程人力與模型成本。
收入品質也要分開看。一次性顧問費能證明客戶願意付錢,訂閱與用量收入則更能反映系統已進入日常流程;成果分成若能建立清楚基線,可能提高上限,但也會帶來歸因與合約爭議。健康的商業組合通常是以前期服務完成導入,再讓軟體、技能模組與執行量成為後續擴張主體。
執行方法:從一個高價值流程開始
企業可先建立失敗分類與回放機制,而不是立即追求完全自動改寫。每週把錯誤依模型、資料、工具、權限、流程與使用者分群,選出高頻且可重現的模式;變更以版本發布,保留對照組與回復點。等到資料量、測試與治理成熟,再讓系統自動提出修改,由工程師核准後進入下一版。
導入時應先定義成功與失敗。成功不只包含平均任務時間下降,也包括錯誤率、人工覆核、法遵事件與使用者採用;失敗則要能被分成模型、資料、權限、工具、流程或組織責任。分類清楚後,每次錯誤才會變成測試資料與產品改進,而不是群組裡又多一張『AI 怎麼又壞了』的截圖。
反方論證:重交付也可能只是昂貴的人力生意
讓 Harness 自動修改自己會增加可預測性與稽核難度。金融、醫療或關鍵製造流程不能只因新版本平均成功率較高,就忽略少數高損失錯誤。自我演進必須受限於可變範圍、評估門檻與人工核准;核心權限、法遵規則與不可逆動作不應由執行軌跡自行放寬。
最複雜的 Harness 不一定最好。每多一個規劃器、評估器或子 Agent,都會增加模型呼叫、延遲與故障點。合理做法是以真實任務做刪減測試:拿掉元件後成功率是否下降、下降多少、值不值得額外成本。最終要最佳化的是每個成功任務的總成本,而不是單次 Token 最便宜。
此外,報告整理的數據包含企業調查、公司案例、產品公告與研究判斷,可信度與時間點並不完全相同。本文保留原始頁碼,並把已發生事實、廠商所述規畫與延伸分析分開呈現。對快速變動的 Agent 市場而言,最危險的不是判斷暫時錯,而是把尚未驗證的規畫寫成已經實現的財務成果。
台灣企業可以怎麼用:先做流程資產負債表
台灣企業最需要先做的,是把目前散落在客服群組、工單與工程師腦中的失敗經驗結構化。建立 Trace、錯誤分類、測試集與變更紀錄後,即使尚未用自我演進演算法,也能讓產品每週變好。這套能力對多模型環境尤其重要,因為模型更換後可以用同一組任務與失敗資料快速驗證。
接下來可固定追蹤:1、失敗軌跡是否完整可回放;2、Harness 版本變更的回歸測試;3、跨任務平均與尾端風險;4、自動修改範圍與人工核准。這些指標同時涵蓋技術、流程與財務,能避免團隊只挑對自己有利的數字。對台灣企業而言,最務實的起點通常不是成立一支龐大 AI 部門,而是選一條跨資料、跨系統、又能直接衡量成本或營收的流程,讓小型 FDE 團隊與業務負責人共同完成第一個生產閉環。
最後要記住,真正的護城河不是 Prompt 數量,而是企業願不願意把規則、失敗案例與決策邊界持續沉澱。模型會升級、單價會下降、工具名稱也會換季;留在公司裡的本體模型、測試資料集、連接器、技能模組、權限設計與營運紀錄,才是能在下一輪技術變化中繼續複利的資產。
Harness 的演進循環
靜態與自我演進 Harness
| 面向 | 靜態流程 | 演進式流程 |
|---|---|---|
| 規則 | 事前人工寫定 | 依失敗資料調整 |
| 優點 | 可預測、易稽核 | 適應新失敗模式 |
| 風險 | 難涵蓋動態環境 | 版本漂移、尾端風險 |
| 治理 | 程式碼審查 | 評測、版本、核准、回復 |
資料來源與策展方法
- 國泰海通證券《FDE 與 Harness 推動 AI 商業化導入》,第9-10頁:靜態工作流程限制、Harness-R1、不同環境的介入位置與自我演進方向
本站未刊載原始券商報告圖片,而是依報告數據重新繪圖、整理表格,再加入 XMY 的商業、財務與經營框架。公司案例與規畫不等於已實現的普遍結果,仍應依最新官方資料與實際專案驗證。