回到 FDE × Harness 20 篇策展
ENTERPRISE AI · EP 07 · Harness 讓 Agent 可靠執行

什麼是 Agent Harness?把會回答的模型,變成能負責完成任務的系統

Harness 管理任務脈絡、記憶、工具、狀態、權限、驗證與復原,是模型進入正式環境的執行底座。

先看結論:企業買的不是模型,而是完成工作的能力

單獨的大型語言模型擅長理解與生成,但企業需要的 Agent 必須記住狀態、呼叫工具、跨多步驟工作、接受權限限制,並在做錯時停止或復原。Harness 就是包在模型外面的執行環境與控制框架。Microsoft 將它形容為把語言模型變成 Agent 的 scaffolding;報告則進一步指出,同一套模型權重放進不同 Harness,最終任務能力可能明顯不同。企業買到的生產力,因此不只由模型排行榜決定。

這個題目值得獨立拆解,因為企業 AI 已經走到第二個階段。第一階段比的是模型能不能回答,第二階段比的是系統能不能在資料不完整、權限複雜、流程跨部門的環境裡,穩定交付可衡量結果。什麼是 Agent Harness?把會回答的模型,變成能負責完成任務的系統不是技術名詞的排列組合,而是一個組織、工程與財務必須同時成立的問題。

運作機制:把人的經驗翻成 Agent 可執行的規則

完整 Harness 至少包含任務脈絡整理、長短期記憶、工具媒合、狀態保存、計畫與執行、檔案記憶、技能載入、人工核准、可觀測性、結果驗證與異常復原。模型每一步提出動作,Harness 檢查權限、執行工具、回收結果、更新狀態,再決定繼續、重試、改道或交給人。它決定模型看到什麼、能做什麼、什麼時候做,以及錯了怎麼辦。

Harness 可以理解為包在模型外面的 Agent 執行環境。它管理任務脈絡、記憶、工具、狀態、權限、驗證、監控與錯誤復原,把一次文字生成變成可以持續做事的系統。模型像大腦,Harness 更像神經、手腳、安全帶與行車紀錄器;少一樣,正式上路都會讓法務和資訊長睡不好。

實務上應先畫出原有流程的輸入、判斷、工具、輸出與例外,再決定哪些環節交給 Agent、哪些需要人工核准。這個順序很重要:若先拿模型找題目,團隊容易做出技術可行但商業低頻的功能;若先找出高成本、高等待或高錯誤的流程,再設計資料與執行環境,投資報酬率才有機會被驗證。

財務視角:從專案收入走向能力複製

企業若只比較模型單價,容易忽略真正的大頭:重試、人工覆核、失敗任務、系統停等與風險事件。較昂貴但成功率高的 Harness,可能有更低的每個成功任務成本;反過來,堆疊太多元件也會增加延遲與模型呼叫。採購應把模型、工具、執行環境、人工與失敗成本合併看,才能比較真實單位經濟。

財務長應把成本拆成五層:場景診斷、資料與系統串接、模型推論、執行框架、上線後的人工作業。初期毛利偏低不必然代表模式失敗,因為第一批客戶可能同時支付產品學習成本;但下一批同類客戶若沒有明顯縮短交付週期,代表知識沒有資產化。最重要的曲線,是每一元新增收入需要多少新增工程人力與模型成本。

收入品質也要分開看。一次性顧問費能證明客戶願意付錢,訂閱與用量收入則更能反映系統已進入日常流程;成果分成若能建立清楚基線,可能提高上限,但也會帶來歸因與合約爭議。健康的商業組合通常是以前期服務完成導入,再讓軟體、技能模組與執行量成為後續擴張主體。

執行方法:從一個高價值流程開始

導入 Harness 時可以從一條任務生命週期開始:輸入如何驗證、需要哪些資料、模型能用哪些工具、哪些步驟必須核准、成功如何確認、逾時或錯誤如何復原。每次執行都留下 Trace、模型版本、工具輸入輸出與人工接管原因,讓團隊能重播問題。沒有可觀測性,就無法知道失敗來自模型、資料、工具還是流程。

導入時應先定義成功與失敗。成功不只包含平均任務時間下降,也包括錯誤率、人工覆核、法遵事件與使用者採用;失敗則要能被分成模型、資料、權限、工具、流程或組織責任。分類清楚後,每次錯誤才會變成測試資料與產品改進,而不是群組裡又多一張『AI 怎麼又壞了』的截圖。

反方論證:重交付也可能只是昂貴的人力生意

Harness 並不是一個固定產品類別,市場上可能以 Agent 平台、工作流程引擎、開發框架或 AIOS 名稱出現。若只追著名詞採購,很容易重複買功能。企業應先列出自己需要的能力與責任邊界,再評估既有雲端、企業軟體與開發平台是否已提供;有時最佳答案是組合,而不是再買一個寫著 Harness 的盒子。

最複雜的 Harness 不一定最好。每多一個規劃器、評估器或子 Agent,都會增加模型呼叫、延遲與故障點。合理做法是以真實任務做刪減測試:拿掉元件後成功率是否下降、下降多少、值不值得額外成本。最終要最佳化的是每個成功任務的總成本,而不是單次 Token 最便宜。

此外,報告整理的數據包含企業調查、公司案例、產品公告與研究判斷,可信度與時間點並不完全相同。本文保留原始頁碼,並把已發生事實、廠商所述規畫與延伸分析分開呈現。對快速變動的 Agent 市場而言,最危險的不是判斷暫時錯,而是把尚未驗證的規畫寫成已經實現的財務成果。

台灣企業可以怎麼用:先做流程資產負債表

台灣企業通常已有 API 管理、身分權限、流程引擎與監控工具,不必全部推倒重來。可先在既有架構上補齊 Agent 的狀態、工具核准、測試與追蹤層,再逐步統一。金融與製造尤其應把權限最小化、操作留痕與人工切換列為第一版必要條件,而不是等模型變聰明後再補安全帶。

接下來可固定追蹤:1、任務狀態能否跨階段保存;2、工具與權限是否最小化;3、錯誤能否重播與復原;4、模型更換是否不需重建流程。這些指標同時涵蓋技術、流程與財務,能避免團隊只挑對自己有利的數字。對台灣企業而言,最務實的起點通常不是成立一支龐大 AI 部門,而是選一條跨資料、跨系統、又能直接衡量成本或營收的流程,讓小型 FDE 團隊與業務負責人共同完成第一個生產閉環。

最後要記住,真正的護城河不是 Prompt 數量,而是企業願不願意把規則、失敗案例與決策邊界持續沉澱。模型會升級、單價會下降、工具名稱也會換季;留在公司裡的本體模型、測試資料集、連接器、技能模組、權限設計與營運紀錄,才是能在下一輪技術變化中繼續複利的資產。

XMY ORIGINAL VISUAL

Agent Harness 的八項基本能力

能力覆蓋示意
圖表由 XMY 依報告數據與架構重新繪製;並列指標僅呈現原始口徑,不將不同單位直接比較。公司案例、規畫與預測不等於必然實現的結果。

模型與 Harness 的分工

層級主要責任失敗風險
模型理解、推理、生成動作幻覺、推理錯誤
Harness脈絡、工具、狀態、驗證編排錯誤、權限過大
企業治理責任、稽核、人工介入流程與組織失靈
SOURCES & METHOD

資料來源與策展方法

  • 國泰海通證券《FDE 與 Harness 推動 AI 商業化導入》第8-9頁Agent Harness 定義、Microsoft Agent Framework 能力、模型與執行環境的分工

本站未刊載原始券商報告圖片,而是依報告數據重新繪圖、整理表格,再加入 XMY 的商業、財務與經營框架。公司案例與規畫不等於已實現的普遍結果,仍應依最新官方資料與實際專案驗證。

風險提醒:企業 AI 仍受客戶預算、資料治理、組織採用、模型成本、技術路線與競爭變化影響。本文僅供研究與教育,不構成證券買賣、採購或法律建議。模型可以很有自信,投資人最好保留計算機。