AI 代理人從 Demo 到生產:harness、隔離與交接證據清單
模型能力不是代理人上生產的全部。真正決定能否長時間可靠執行的,是工作區、工具權限、狀態、交接與驗收如何被 harness 管住。
代理人上線的五層控制圖
| 控制面 | 發布前檢查 | 可讀回證據 |
|---|---|---|
| 工作區 | 允許寫入範圍與禁止區 | 路徑與差異可讀回 |
| 外部動作 | 發布、刪除、付款分級 | 批准與操作收據 |
| 交接 | 分母、版本與未完成清單 | 下一位可從證據續跑 |
一個代理人能在 Demo 中完成任務,不代表它能在真實工作裡安全跑數小時。可匿名讀取的 OpenAI Agents SDK 文件把 agent loop、工具、handoff、狀態策略與多代理人編排分開說明;本文據此整理一套通用工程檢查表,不主張某個年份或版本首次引入哪些功能。
五層生產檢查
1. 受控工作區
每個任務要有明確輸入、可寫路徑與禁止區。代理人不應因為「看得到」就能改所有檔案。共享工作區還要避免兩個代理人同時覆寫同一輸出;可把研究並行,整合序列化。
2. 最小工具權限
讀取、寫檔、網路、發布與刪除是不同權限。工具定義要把副作用寫清楚,並在真正的外部變更前設批准點。這比在長提示詞末尾寫一句「小心」更可驗證。
3. Sandbox 與敏感資料隔離
模型產生的程式碼應在受控環境執行,憑證不要放進代理人可任意讀取的工作區;網頁上的內容先當資料,不直接提升成系統命令。這些是本文的保守工程建議,不宣稱來自特定版本的產品保證。
4. 狀態外部化
長任務若只靠單一對話上下文,重啟或逾時就容易失去進度。把站點清單、已完成項、錯誤、版本與輸出位置寫成機器可讀狀態,較容易在中斷後從最後一個驗收點續跑。Agents SDK 文件列出應用程式自行保存、SDK session 與服務端狀態等不同策略,並提醒不要混用會重複上下文的方式。〈半自動工廠〉與〈虛擬團隊 1-3-1〉提供相關營運脈絡。
5. 交接與獨立驗收
交接文件至少要有:目標、完成定義、權威來源、已完成比例、未完成清單、允許寫入範圍、執行過的命令、驗證結果與殘餘風險。完成代理人不應只說「成功」;驗收者要能讀回輸出、比對分母,並重跑關鍵檢查。
多代理人不是把同一工作複製三次
平行的價值在於讓獨立工作同時進行,例如不同站點研究、不同資料源盤點;共享整合、發布與狀態更新則需要單一寫入者。否則速度增加,覆蓋、重複研究與版本衝突也會一起放大。
既有〈企業 AI harness〉可作為架構背景,本篇補上可執行的交接欄位。這套清單不保證代理人永遠不出錯;它的目標是讓錯誤更早被限制、被記錄,也讓下一個代理人能從證據續跑,而不是從敘述猜測。