先看結論:企業買的不是模型,而是完成工作的能力
Agent 商業化的核心指標,正從單次模型價格移向每個成功任務的總成本。報告整理 Anthropic 實驗:同樣使用 Claude Opus 4.5 建立應用,單 Agent 約運行20分鐘、成本約9美元;包含規劃器、生成器與評估器的完整 Harness 約運行6小時、成本約200美元,成本超過20倍,但完整度、可用性與核心功能正確性也明顯較好。問題不是誰最便宜,而是多付的錢換到多少成功率與商業價值。
這個題目值得獨立拆解,因為企業 AI 已經走到第二個階段。第一階段比的是模型能不能回答,第二階段比的是系統能不能在資料不完整、權限複雜、流程跨部門的環境裡,穩定交付可衡量結果。別再只比 Token 價格:Cost per Successful Task 才是 Agent 的真實生產力不是技術名詞的排列組合,而是一個組織、工程與財務必須同時成立的問題。
運作機制:把人的經驗翻成 Agent 可執行的規則
Cost per Successful Task 可以寫成:一次任務的模型、工具、基礎設施、人工與失敗成本總和,除以真正達標的任務數。若便宜模型需要多次重試與大量人工覆核,分母變小、分子變大,最後反而更貴。Harness 的規劃、評估與復原元件,應以對成功率、錯誤損失與週期的增量貢獻衡量,而不是看功能清單長度。
Harness 可以理解為包在模型外面的 Agent 執行環境。它管理任務脈絡、記憶、工具、狀態、權限、驗證、監控與錯誤復原,把一次文字生成變成可以持續做事的系統。模型像大腦,Harness 更像神經、手腳、安全帶與行車紀錄器;少一樣,正式上路都會讓法務和資訊長睡不好。
實務上應先畫出原有流程的輸入、判斷、工具、輸出與例外,再決定哪些環節交給 Agent、哪些需要人工核准。這個順序很重要:若先拿模型找題目,團隊容易做出技術可行但商業低頻的功能;若先找出高成本、高等待或高錯誤的流程,再設計資料與執行環境,投資報酬率才有機會被驗證。
財務視角:從專案收入走向能力複製
不同任務的容許成本差異很大。生成一則內部摘要,200美元幾乎不合理;完成價值數萬美元、錯誤代價高的程式或交易審查,200美元可能非常便宜。財務模型應分任務類型,設定單次商業價值、錯誤損失、人工成本與服務水準,再選擇模型與 Harness 深度。平均 Token 單價無法跨任務直接比較。
財務長應把成本拆成五層:場景診斷、資料與系統串接、模型推論、執行框架、上線後的人工作業。初期毛利偏低不必然代表模式失敗,因為第一批客戶可能同時支付產品學習成本;但下一批同類客戶若沒有明顯縮短交付週期,代表知識沒有資產化。最重要的曲線,是每一元新增收入需要多少新增工程人力與模型成本。
收入品質也要分開看。一次性顧問費能證明客戶願意付錢,訂閱與用量收入則更能反映系統已進入日常流程;成果分成若能建立清楚基線,可能提高上限,但也會帶來歸因與合約爭議。健康的商業組合通常是以前期服務完成導入,再讓軟體、技能模組與執行量成為後續擴張主體。
執行方法:從一個高價值流程開始
企業可以建立一張 Agent 單位經濟表:每類任務記錄成功定義、一次執行成本、重試次數、人工分鐘、完成時間與錯誤損失。接著做消融測試,逐一拿掉規劃器、評估器或子 Agent,觀察成功率下降多少。只有當元件帶來的增量價值高於增量成本,才留在正式環境。這也是控制架構複雜度最公平的方法。
導入時應先定義成功與失敗。成功不只包含平均任務時間下降,也包括錯誤率、人工覆核、法遵事件與使用者採用;失敗則要能被分成模型、資料、權限、工具、流程或組織責任。分類清楚後,每次錯誤才會變成測試資料與產品改進,而不是群組裡又多一張『AI 怎麼又壞了』的截圖。
反方論證:重交付也可能只是昂貴的人力生意
成功任務成本仍可能被錯誤定義操弄。若把『產出一份文件』當成功,卻不管文件是否被採用、是否導致錯誤決策,指標仍然漂亮但沒有價值。成功條件應接近業務結果,並納入尾端風險;高平均成功率若偶爾造成重大法遵或金流事件,不能用平均值沖掉。
最複雜的 Harness 不一定最好。每多一個規劃器、評估器或子 Agent,都會增加模型呼叫、延遲與故障點。合理做法是以真實任務做刪減測試:拿掉元件後成功率是否下降、下降多少、值不值得額外成本。最終要最佳化的是每個成功任務的總成本,而不是單次 Token 最便宜。
此外,報告整理的數據包含企業調查、公司案例、產品公告與研究判斷,可信度與時間點並不完全相同。本文保留原始頁碼,並把已發生事實、廠商所述規畫與延伸分析分開呈現。對快速變動的 Agent 市場而言,最危險的不是判斷暫時錯,而是把尚未驗證的規畫寫成已經實現的財務成果。
台灣企業可以怎麼用:先做流程資產負債表
台灣企業常從採購折扣看 AI 成本,但 Agent 真正影響的是人工作業、週期與錯誤。建議由財務、業務與資訊共同定義任務單位,先用十到五十個真實案例建立基線,再談大規模合約。對供應商而言,能提供成功任務成本、失敗分布與人工接管數據,會比只報 Token 便宜更接近企業買方語言。
接下來可固定追蹤:1、成功條件是否連到業務結果;2、單次任務的完整成本;3、重試與人工覆核占比;4、高損失尾端錯誤。這些指標同時涵蓋技術、流程與財務,能避免團隊只挑對自己有利的數字。對台灣企業而言,最務實的起點通常不是成立一支龐大 AI 部門,而是選一條跨資料、跨系統、又能直接衡量成本或營收的流程,讓小型 FDE 團隊與業務負責人共同完成第一個生產閉環。
最後要記住,真正的護城河不是 Prompt 數量,而是企業願不願意把規則、失敗案例與決策邊界持續沉澱。模型會升級、單價會下降、工具名稱也會換季;留在公司裡的本體模型、測試資料集、連接器、技能模組、權限設計與營運紀錄,才是能在下一輪技術變化中繼續複利的資產。
單 Agent 與完整 Harness 實驗成本
成功任務成本的五個組成
| 成本 | 包含內容 | 常見漏算 |
|---|---|---|
| 模型 | 輸入輸出與重試 | 多 Agent 重複呼叫 |
| 工具 | 搜尋、資料庫、第三方 API | 外部服務費 |
| 基礎設施 | 執行、儲存、監控 | 長任務等待 |
| 人工 | 覆核、接管、除錯 | 資深人員時間 |
| 失敗 | 重工、延誤、風險事件 | 尾端大損失 |
資料來源與策展方法
- 國泰海通證券《FDE 與 Harness 推動 AI 商業化導入》,第10-11頁:Harness 效果—成本權衡、Anthropic 單 Agent 與完整 Harness 實驗、成功任務成本指標
本站未刊載原始券商報告圖片,而是依報告數據重新繪圖、整理表格,再加入 XMY 的商業、財務與經營框架。公司案例與規畫不等於已實現的普遍結果,仍應依最新官方資料與實際專案驗證。