AI 知識

AI 記更多經驗,為什麼在一項研究中反而找得更差?

我們常把「給 AI 更多過往經驗」當成理所當然的進步方向。但如果把一長串探索歷程壓成幾句方向提示,AI 可能太早相信某條路,放棄本來值得試的其他路。Dream-RSI 研究用一組長程自動探索實驗,呈現了這個反直覺結果。

研究在解什麼問題?

研究對象不是一般聊天機器人,而是會反覆提出候選方案、執行評估、再繼續尋找的 AI agent。它可能在改進演算法、尋找數學構造,或優化 GPU 程式。當嘗試多到需要決定「下一步去哪裡找」,探索策略本身就成了問題。若每一種策略都從頭跑完整輪,成本很高。

Dream-RSI 怎麼做?

它把已完成的探索歷程保存成樹:每個分岔記錄從哪個嘗試延伸、得到什麼結果。研究團隊把這些已經發生過的結果當成可重播的環境。新的探索策略先在舊樹上選路,系統直接回傳記錄中的結果,無須為每種策略重跑底層 agent。選出策略後,再放回真正的新探索,並把新歷程加入下一輪重播。

這好比走迷宮時,保存每條走過的路與死巷。下一個人可以先用地圖比較路線,再決定真正要走哪裡。但地圖只記錄走過的區域,不能保證未探索的地方沒有更好路;新探索仍不可少。

「經驗小抄」為什麼可能幫倒忙?

論文也測試另一種常見方式:把過去的探索濃縮成高層次方向提示,直接放進後續 prompt。在其 ConvDiv 長程探索分析中,這種明確的方向性提示,在相同預算下比沒有該提示的版本表現更差。研究者的解釋是:強烈的既有方向可能壓縮探索空間,讓平行嘗試變得不夠多樣。

這是特定實驗設定下的觀察,不能推成「所有摘要都會讓 AI 變笨」,也不能說一般個人助理不該保存記憶。研究真正對比的是:把歷程當一句結論灌入 prompt,和保留可檢驗的探索路徑,兩種使用經驗的方法。

值得帶走什麼?

對需要長時間試錯的工作,留下「試過什麼、結果如何、從哪裡分岔」,可能比只留一句「最佳方向」更有用。Dream-RSI 把這個想法做成可迭代的策略改善流程;研究報告在演算法、數學與 GPU kernel 任務的數項設定中,取得與比較方法相當或更好的發現品質,並降低部分探索成本。這仍是研究中的實驗結果,不是任何 agent 都能直接套用的效能承諾。

資料:Dream-RSI 預印本 https://arxiv.org/html/2609.14858v1;研究專頁 https://dream-rsi.com/。查證日期:2026-09-23。

回文章列表