AI 知識
從分數走向可追溯的放行證據
AI Agent 最讓人期待的地方,是它不只會回答問題,還能呼叫工具、修改檔案、跑測試,甚至把一串任務做完。
但只要它準備替人做下一個有影響力的動作,例如合併程式碼、更新設定或送出操作,問題就不再只是「它剛剛寫得好不好」。真正的問題是:我們憑什麼相信它現在可以被放行?
分數不是一張通行證
看到某個 Agent 得到 90 多分,很容易把它理解成「大致可以放心」。可是分數本身不會告訴你,它測了什麼、在哪個環境測、給了多少次重試,也不會告訴你它是不是剛好學會了某個測試的套路。
因此,先問分數代表什麼,比先問分數高不高重要。
若成功條件沒有寫清楚,Agent 可能只是完成了一個看似合理的版本。若測試環境每次不同,分數可能混進環境波動。若只看最後輸出,則很難分辨它是穩定完成,還是剛好走到正確結果。
對能使用工具、改變環境狀態的 Agent,評估不是一張成績單,而是一套讓人追得回來的證據鏈。
第一關:先把「成功」講清楚
不要先讓 Agent 動手,再回頭判斷結果喜不喜歡。較好的起點是先寫出任務邊界:要解決哪一個需求、哪些既有行為不能被破壞、完成後要留下什麼可驗證結果。
這一步聽起來不像 AI 技術,卻是整件事最重要的部分。因為同一句「把這個問題修好」,不同的人可能理解成不同範圍;Agent 只會把這種模糊放大成更快的執行。
成功條件越具體,後面的測試與判斷才越有地方落腳。
第二關:用可重現測試看結果
對程式或可操作流程來說,最可靠的問題通常很直接:它有沒有做到?既有功能有沒有壞掉?
這是可重現測試最有價值的地方。它不需要猜 Agent 的意圖,而是檢查輸出是否達成明確條件。測試可以是單元測試、端對端檢查、輸入輸出驗證,或是限制條件是否仍被守住。
不過,測試通過也不是萬靈丹。測試只會回答它被設計來問的題目。沒有被涵蓋的邊界情境、錯誤假設與長期維護問題,仍可能藏在外面。
所以「能跑」不應直接翻譯成「可以自動合併」。它只能證明其中一部分。
第三關:保留過程,才有辦法追錯
Agent 的工作不是一個黑盒子輸入輸出。它會挑工具、讀資料、嘗試不同操作,再根據中間結果改變路徑。
把這些過程留下來,有兩個好處。第一,出錯時可以知道偏離從哪一步開始,而不是只看到最後失敗。第二,成功時也能辨識它是不是依靠一條不可重複的巧合路徑。
這種過程紀錄不必變成冗長報告,但至少要能回答:它動了哪些地方?跑過哪些檢查?遇到失敗後怎麼處理?最後的結果靠什麼證明?
主觀品質,交給不只一種判準
有些問題無法只靠測試決定,例如文字是否清楚、回覆是否符合情境、方案是否兼顧維護性。這時模型評分或人工審閱很有用。
但它們適合補強,不適合變成唯一裁判。多重判準的價值,不是把流程弄得更複雜,而是讓不同類型的失敗有不同守門人:
- 可重現測試看硬結果。
- 模型或人工審閱看品質與脈絡。
- 過程紀錄讓人追查行為與失敗原因。
把三者放在一起,才比較接近「這個 Agent 能不能做下一步」的問題。
自動化真正需要的是放行規則
AI 讓執行速度越來越快,但速度不是放行的理由。
真正值得投入的,不只是讓 Agent 會做更多事,而是先設計清楚:什麼條件下它可以繼續?什麼情況必須停下來交給人?一旦結果不對,能不能從紀錄找到原因?
當這些問題有答案,分數才開始有意義。
因為一個可靠的 Agent,不是永遠不犯錯的 Agent,而是就算出錯,也不會在沒有證據的情況下被一路放行。
參考資料
- Anthropic, “Demystifying evals for AI agents”
https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents
- Google DeepMind, “FACTS Grounding: A new benchmark for evaluating the factuality of large language models”
- OpenAI, “A shared playbook for trustworthy third party evaluations”
https://openai.com/index/trustworthy-third-party-evaluations-foundations/
回文章列表