AI 知識
真正該看的,是每個成功任務的總成本
看到 AI 模型降價,多數人的第一反應是:同樣的工作,帳單應該跟著下降。
但進入會搜尋、讀檔、執行程式、操作瀏覽器與自我驗證的 Agent 時代後,「每百萬 Token 單價」已經不足以代表真正成本。它比較像計程車的每公里費率,卻沒有告訴你路線多長、繞了幾次路、停等多久,以及最後是否真的抵達目的地。
Token 單價只是第一層
一個 AI 任務最基本的費用,來自輸入與輸出 Token。輸入不只包含你打的那句問題,還可能包括系統規則、歷史對話、文件內容、工具說明與先前執行結果。輸出也不只是一段最後答案,模型在長任務中可能反覆產生計畫、工具參數、檢查結果與修正內容。
這也是為什麼兩個看起來一樣的問題,放進不同的工作流,最後用量可能差很多。
推理強度會改變投入
新一代模型開始讓使用者調整 effort,也就是模型願意為任務投入多少推理與計算。較低設定適合直接、可逆、容易驗證的工作;較高設定則留給需要多步推理、長程規劃或高錯誤成本的任務。
把每一題都開到最高,不代表每一題都更划算。真正合理的做法,是讓任務難度決定推理強度,而不是讓模型名稱決定所有設定。
Agent 的工具呼叫會把工作拉長
一般聊天的成本通常停在一次輸入與一次輸出。Agent 不同:它可能先搜尋,再讀取網頁,接著執行程式,發現結果不一致後重新搜尋,最後打開瀏覽器驗收。
這些動作能提高完成率,卻也會持續把新內容送回模型。工具本身可能有費用,每一次往返也會增加上下文與輸出。因此,Agent 成本應該以整段執行追蹤,而不是只看最後那段回答。
自我驗證不是免費的
模型會自己檢查、重跑與修正,通常是好事。它能避免把第一個看似合理的答案直接交付,也可能減少人工返工。
問題在於,如果沒有停止條件,驗證可能變成沒有上限的迴圈。常見控制方式包括:限制最大步數、工具呼叫次數、重試次數、總 Token 預算與執行時間;遇到高風險操作時,再要求人工確認。
這些限制不是削弱 AI,而是替它定義「做到什麼程度算完成」。
速度也可能有溢價
同一模型若提供低延遲或加速模式,通常代表使用者可以用更高價格換取更短等待時間。這在即時互動、客服或緊急分析中可能值得,但對背景批次工作未必必要。
因此,速度不應被視為固定需求,而應按場景分級:哪些任務真的需要立刻完成,哪些任務可以排隊,哪些甚至可以用批次方式處理。
應該看「每個成功任務的總成本」
比較 AI 模型時,最實用的單位不是每百萬 Token,而是每個成功任務:
任務總成本 = 模型用量 + 工具費用 + 重試與驗證 + 速度溢價
再把這個數字與成功率、人工接手時間及交付品質一起看,才知道模型是真的便宜,還是只把成本藏到更長的執行路徑裡。
四個可以立刻採用的控制方法
第一,按任務難度設定推理強度。分類、格式轉換與簡單摘要不必一律使用最高設定。
第二,設定清楚的步數、重試與工具上限。每個 Agent 都應該知道何時停止、何時回報、何時請人決定。
第三,重複使用的系統規則、長文件與固定前綴使用快取,避免每一輪都重新計算相同內容。
第四,記錄完整任務軌跡。至少保留輸入/輸出 Token、工具次數、重試次數、總時間、成功與否,才能找出真正的成本熱點。
AI 模型的單價會持續下降,能力也會持續上升。但越能自己規劃與行動的模型,越需要成本、權限與驗收邊界。最後真正拉開差距的,不會只是誰拿到最便宜的 Token,而是誰能用最少的無效步驟,穩定完成可驗收的任務。
查證摘要
- Anthropic 於 2026-07-24 說明 Claude Opus 5 的 effort setting 可在智慧、速度與 Token 使用量之間調整,代表同一模型也會因推理強度改變實際成本。
- 同一公告明列一般 API 價格與 Fast mode 價格,證明速度選項也可能改變帳單,不是單一模型名稱就能概括。
- 官方以 cost per task 比較不同模型與 effort level,支持本篇「應比較任務總成本」的主軸。
- Claude Platform 的 prompt caching 與 token counting 文件顯示:固定前綴重複利用與事前估算,都會直接影響任務總成本與預算控制。
- 主要資料:Anthropic|Introducing Claude Opus 5、Claude Platform|Prompt caching、Claude Platform|Token counting。
