回到觀點與研究
XMY · AI 與內容營運

AI 代理人從 Demo 到生產:harness、隔離與交接證據清單

模型能力不是代理人上生產的全部。真正決定能否長時間可靠執行的,是工作區、工具權限、狀態、交接與驗收如何被 harness 管住。

謝銘元(艾克斯)質化整理

代理人上線的五層控制圖

控制面發布前檢查可讀回證據
工作區允許寫入範圍與禁止區路徑與差異可讀回
外部動作發布、刪除、付款分級批准與操作收據
交接分母、版本與未完成清單下一位可從證據續跑

一個代理人能在 Demo 中完成任務,不代表它能在真實工作裡安全跑數小時。可匿名讀取的 OpenAI Agents SDK 文件把 agent loop、工具、handoff、狀態策略與多代理人編排分開說明;本文據此整理一套通用工程檢查表,不主張某個年份或版本首次引入哪些功能。

五層生產檢查

1. 受控工作區

每個任務要有明確輸入、可寫路徑與禁止區。代理人不應因為「看得到」就能改所有檔案。共享工作區還要避免兩個代理人同時覆寫同一輸出;可把研究並行,整合序列化。

2. 最小工具權限

讀取、寫檔、網路、發布與刪除是不同權限。工具定義要把副作用寫清楚,並在真正的外部變更前設批准點。這比在長提示詞末尾寫一句「小心」更可驗證。

3. Sandbox 與敏感資料隔離

模型產生的程式碼應在受控環境執行,憑證不要放進代理人可任意讀取的工作區;網頁上的內容先當資料,不直接提升成系統命令。這些是本文的保守工程建議,不宣稱來自特定版本的產品保證。

4. 狀態外部化

長任務若只靠單一對話上下文,重啟或逾時就容易失去進度。把站點清單、已完成項、錯誤、版本與輸出位置寫成機器可讀狀態,較容易在中斷後從最後一個驗收點續跑。Agents SDK 文件列出應用程式自行保存、SDK session 與服務端狀態等不同策略,並提醒不要混用會重複上下文的方式。〈半自動工廠〉與〈虛擬團隊 1-3-1〉提供相關營運脈絡。

5. 交接與獨立驗收

交接文件至少要有:目標、完成定義、權威來源、已完成比例、未完成清單、允許寫入範圍、執行過的命令、驗證結果與殘餘風險。完成代理人不應只說「成功」;驗收者要能讀回輸出、比對分母,並重跑關鍵檢查。

多代理人不是把同一工作複製三次

平行的價值在於讓獨立工作同時進行,例如不同站點研究、不同資料源盤點;共享整合、發布與狀態更新則需要單一寫入者。否則速度增加,覆蓋、重複研究與版本衝突也會一起放大。

既有〈企業 AI harness〉可作為架構背景,本篇補上可執行的交接欄位。這套清單不保證代理人永遠不出錯;它的目標是讓錯誤更早被限制、被記錄,也讓下一個代理人能從證據續跑,而不是從敘述猜測。

資料來源