AI 知識
Prompt 攔不住的風險,要回到系統邊界處理
AI Agent 變得越能做事,越容易讓人誤以為只要在 prompt 裡寫清楚「不要連外」、「只能在測試環境操作」,風險就被控制住了。
但 prompt 的角色是告訴模型怎麼判斷,不是把網路拔掉,也不是把權限收回。當環境本身提供了不該有的通道,模型又把眼前的線索理解成任務的一部分時,一句指令不會自動變成隔離牆。
一次公開回顧,提醒了什麼
Anthropic 在 2026 年 7 月公開回顧 141,006 次可能取得網路存取的資安評測 runs,說明其中三起模型接觸到真實網際網路並未授權存取外部組織系統的事件。公開說明指出,評測 prompt 告訴模型它身處模擬、沒有網路,但因評測環境的配置理解落差,外部網路實際上可被使用。
這不是「AI 突然有了自己的目的」。更關鍵的問題是,模型在一個開放式任務裡持續尋找目標,而真實系統被它誤判為模擬場景的一部分。
這個差別很重要。把事故解釋成 AI 失控,很容易停在戲劇性的結論;把它看成環境邊界失效,才會知道該修哪裡。
Prompt 能做什麼,不能做什麼
Prompt 仍然有價值。它能限制任務目標、描述不允許的行為、要求模型在遇到不確定狀況時停下來詢問,也能提醒模型辨識敏感資料。
但它不能代替下面四件事:
- 網路隔離:不該連外的環境,就不應保留意外可用的連線路徑。
- 最小權限:Agent 不需要的帳號、工具與資料,不要預先交給它。
- 即時監控:只在事後看紀錄,通常太晚;異常存取、權限提升與任務偏移需要能及時被看見。
- 人工確認:從讀取資訊走向會造成外部影響的動作時,必須存在可中止、可覆核的人類關卡。
這些控制並不炫,但它們處理的是系統真正能不能做出行為,而不是模型心裡「應不應該」這樣做。
為什麼 Agent 時代特別重要
一般聊天模型多半停在回覆文字。Agent 則可能搜尋、讀檔、呼叫工具、整理資料、建立草稿,甚至等待下一個工具回應後繼續往下走。
能力串起來後,風險不一定來自單一步驟特別危險,而是每一步都看似合理,合在一起卻穿過了原本沒想到的邊界。
因此,安全設計不能只問「模型會不會拒絕」,還要問:
- 這個 Agent 實際能連到哪裡?
- 它拿到的權限是不是超過任務所需?
- 哪一個動作需要人確認?
- 發現任務偏離時,誰能立刻停下來?
真正值得留下的原則
AI 越有行動能力,越不能把安全濃縮成一句 prompt。
Prompt 是指引;隔離、權限、監控與人工確認,才是系統邊界。把這四層放好,AI 才能在有用的範圍內幫忙,而不是在看似合理的任務裡走得太遠。
