AI 知識

從一次成功走向可移轉的 Agent 知識

很多人會期待,AI Agent 做過一次任務後,下一次就會更熟練。它應該記得哪裡容易出錯、哪種做法有效、哪些條件不能忽略。

但實際使用時,常見的感受剛好相反:上一次已經摸索很久的問題,換一個任務、換一個 Agent,甚至只是隔一段時間再問,就像又回到起點。

這不一定是模型能力不足。有時問題在於,經驗根本沒有被做成可以傳下去的東西。

對話紀錄很多,不等於知識真的留下來

一段長對話裡,可能有嘗試過的步驟、錯誤訊息、暫時的假設與最後答案。但它同時也有重複、誤判、只適用於當下的細節,以及後來已經失效的資訊。

把所有聊天紀錄原封不動保存,像是把每天的草稿、便條紙與失敗版本全塞進一個抽屜。資料確實變多了,但下一個人要找答案時,反而得先重新辨認哪些東西可信。

所以「有記憶」和「有知識」不是同一件事。記憶可以只是留下來;知識必須能被核對、理解與再次使用。

把改進放在 Agent 身上,常常很難帶走

常見的自我改進方法,是繼續調整 prompt、工作流程、工具組合,甚至直接修改 Agent 的程式。這些作法可能有效,但改進往往綁在特定模型、特定任務分布或某次執行環境上。

一旦換了模型、換了 Agent,或任務稍微改變,原本學到的東西可能就不容易帶走。

一篇名為 Knowledge-Centric Self-Improvement 的研究提出另一個方向:不要只問「這個 Agent 要怎麼變強」,也要問「每一次任務留下了什麼,能讓下一次不用重學?」

這個觀點把焦點從一個會持續變形的 Agent,移到一份可以持久保存、被多人或多個 Agent 共用的知識。

一個能累積的循環,至少有四步

研究中的流程並不是讓 Agent 把所有內容直接寫進資料庫,而是多加了幾道必要的整理。

1. 留下有證據的發現

任務做完後,真正值得留下的不只是結論,還包括它為什麼成立。例如一個做法在哪種條件下成功、失敗時出現什麼訊號、哪些檢查能排除錯誤。

這讓下一次使用的人,不必只相信一句「這樣做就好」,而可以回看根據。

2. 讓不同任務的經驗互相對照

單一任務的解法,未必能直接套到另一個任務。把經驗放在一起,才有機會發現哪些規則是共通的、哪些只是偶然有效、哪些內容互相矛盾。

這一步最重要的不是累積數量,而是辨識範圍。能說清楚「什麼時候可用」,通常比一條看似萬用的建議更有價值。

3. 濃縮,而不是無限堆疊

知識庫若只會增加,很快也會變成另一種雜物間。研究提出的知識蒸餾,重點是把反覆出現、已被支持的經驗整理成更短、更可用的內容,同時保留需要回查的證據。

好的濃縮不是把細節刪光,而是讓下一次任務先拿到最重要的規則;真的遇到例外時,再回到原始資料核對。

4. 讓下一個 Agent 從比較高的起點出發

當知識住在 Agent 外部,而不是只藏在某次對話或某個 prompt 裡,不同模型、不同 Agent 都有機會使用同一份已整理的經驗。

這就是「知識飛輪」比較有意思的地方:每次任務不只是在完成眼前工作,也可能讓下一次少走一段已知的彎路。

最容易搞錯的地方:把收藏當成累積

不少人已經有 prompt 收藏、範例資料夾或長長的聊天紀錄。它們很有用,但還不等於可靠的共同知識。

要判斷一份內容能不能真的傳下去,可以先問三個問題:

  1. **它有沒有根據?** 這條做法是來自已驗證的結果,還是一次剛好成功的嘗試?
  2. **它的適用範圍清不清楚?** 哪些條件下可用,哪些情況需要改走別條路?
  3. **它能不能被下一個人讀懂?** 如果只剩原作者知道背景,這份內容仍然很難被重用。

少了這三件事,資料越多不一定越好。下一個 Agent 可能只是更快地讀到更多雜訊。

AI 的進步,不只在換更強的模型

模型變強當然重要,但任務能不能越做越少重工,也取決於經驗有沒有被做成可靠的公共層。

研究在抽象推理、程式與 terminal benchmark 的控制實驗中,觀察到這種知識導向程序相較其比較基線有更高的解題率與更低的成本,且濃縮後的知識能轉移到保留任務與不同模型家族。這是特定研究設定下的結果,不代表任何知識庫一建立就會自動有效;真正困難的地方,仍在於證據、整理、衝突處理與持續更新。

不過它提供了一個很實用的判斷:不要只問 AI 這次答得好不好,也要問這次留下的經驗,下一次能不能被驗證地接住。

如果答案是否定的,那麼再多次成功,都可能只是反覆從零開始。

參考資料

回文章列表