AI 知識

選項名稱一換,AI 的決定就翻了?格式正確不等於判斷正確

AI 回答得很整齊,不代表它真正讀懂了規則。一項 2026 年 9 月公布的研究預印本,把決策模型的選項名稱與定義重新配對,發現部分模型會被名稱原本的意思牽著走,即使輸出仍完全符合指定格式。這不是對所有 AI 的判決,而是一個值得檢查的系統設計風險。

研究究竟改了什麼?

想像一個系統請 AI 判斷客服案件是否要人工介入,預先給它「yes」與「no」兩個選項,每個選項都附有明確的文字定義。研究者保留題目、案件內容、選項名稱和定義文字,只對調「哪個名稱綁哪個定義」。如果模型依文字定義作答,對調後仍應選到相同的定義,只是回傳的名稱會變。

研究涵蓋三類結構化決策模型;其中 Jev 在 1,200 道英文工作流程決策題上接受測試。就受測的 Jev 版本而言,對調 yes/no 名稱與定義後,有 32.5% 的題目改選另一個定義;若選項名改為中性的 0/1,同樣測法的變動率為 2.08%。這裡量到的是「選到不同定義的比例」,不能直接稱為模型平常的錯誤率。研究全文

為什麼格式檢查抓不到?

這類模型只會從預先列出的選項回覆。它能保證輸出在選項內,卻不能單靠這件事證明它依照選項定義理解問題。研究的所有測試條件中,輸出類型錯誤率維持 0%,但決定仍可能因名稱與定義的配對改變而翻轉。研究全文

這和一般人直覺中的「亂編一段答案」不同:系統可以取得完全合法的 yes 或 no,接著照流程執行,卻不知道模型依據的是名稱慣用意思,還是你寫下的定義。TypeSafe 對 Jev 的官方介紹說明,它的輸出是帶機率的結構化決定,而非自由文字;本研究檢驗的正是「結構正確」之外的語意問題。

可以怎麼檢查?

  1. 把關鍵選項的文字定義寫清楚,別只靠「通過/拒絕」這類名稱暗示意思。
  2. 在測試集裡對調名稱與定義的配對,核對模型是否仍選到相同的定義;不要只看 JSON 格式有沒有通過。
  3. 對可能造成金錢、權限或不可逆動作的決定,另設可核對的規則或人工確認,不把單次模型答案當成最終授權。

研究作者提出使用中性名稱與對調測試作為檢查方向,但沒有證明這些做法能修好所有情境。它們是用來揭露風險的方法,不是品質保證。研究討論與限制

什麼情況不能直接套用?

這份研究使用英文題目、有限的決策任務與模型版本;Jev 是經 API 存取的封閉模型,日後版本可能改變。不能從這些數字推論所有聊天 AI、中文選項或實際企業流程都有相同比例的翻轉。對單純草稿、摘要或靈感探索,也不必把每個詞都當成高風險自動決策;重點是判斷結果會不會被程式直接拿去執行。

最值得帶走的問題不是「AI 還能不能用」,而是「我們驗證的是答案的格式,還是答案真的符合定義?」

本文由奧微軟體開發企業社編輯,未受研究作者或 TypeSafe 委託。資料核對日期:2026-09-26。原始資料:Yu Sun 等人,arXiv:2609.26758v2;TypeSafe 官方介紹。

回文章列表