AI 知識

一分鐘了解什麼是AI詞元:你打的字數,不等於模型算的長度

同樣一段文字,為什麼換個模型,長度可能就變了?關鍵在於:模型處理文字時,通常不是照你眼睛看到的字數計算,而是先經過分詞器,切成一串詞元。

詞元,英文叫 token。它不是「一個字」的新名字,也不是「一個完整單詞」的固定同義詞。把這件事弄清楚,看模型長度規格時就少一個常見誤會。

詞元到底是什麼?

對文字模型來說,輸入文字先經過切分及編碼,形成模型可以處理的單位與編號。分詞器決定如何切、每個單位對應什麼編號;模型則以編碼後的輸入進行後續處理。這裡說的是文字,不能直接套用到圖片或聲音。Hugging Face分詞流程與SentencePiece作者文件展示了切分及編碼的關係。

你可以把文字想成一段待拼接的路徑,詞元是沿路的小片段。這只是幫助理解的比喻,不表示每一片都存著一份完整知識。

為什麼不能直接用字數換算?

分詞方式不只一種。有的以字元為單位,有的保留常見詞,有的把較少見的詞拆成更小片段。空白與標點也可能進入編碼。因此「一個中文字一定等於一個詞元」及「一個英文單詞一定只占一個詞元」,都不宜當成通用規則。Hugging Face分詞演算法文件說明了字元與子詞等方法。

真正決定結果的是對應的分詞器與詞彙表。同一段文字送給不同分詞器,切分及詞元數可能不同;沒有指定模型與工具的換算表,至多只能作粗估,不能當作核對後的精確值。

看長度規格時,先分清楚你在看什麼

看到服務宣稱能處理多少詞元,不要直接改寫成能處理多少中文字。詞元數與字數不是同一個單位,服務自己的輸入限制也要另外核對。這是閱讀規格的提醒,不是對任何產品當期容量的保證。

也別把詞元數當成理解能力分數。切得多或切得少,單憑這件事不能得出模型更聰明的結論;比較回答是否適合任務,仍要看實際內容。

想估算自己的長文,怎麼做比較可靠?

先確認你要使用的模型或服務,再找對應的分詞器或計數工具。放入準備使用的實際文字,記下工具及模型名稱,最後與該服務公布的長度限制核對。換模型、換工具或改動文字後,再算一次,不沿用舊數字。

這個流程適合需要核對文字長度的人。若服務不提供對應工具,只能估算,就明講估算;不拿別的模型算出的數字冒充精確結果。本文不提供每字費用、通用換算率或特定服務入口。

一句話記住

詞元是模型處理文字的單位,不是字數換個名字,更不是懂了多少的成績。分清字數與詞元,再看規格,就不容易把同一件事用錯單位。

你曾經碰過「字數看起來不多,工具卻說太長」的情況嗎?更多AI名詞解析,見奧微軟體BLOG。

作者:奧微軟體 AugurSoft。本文為品牌自有知識內容,並非模型供應商的容量、價格或服務承諾。查核日期:2026-10-03。

配樂:Carefree — Kevin MacLeod(incompetech.com)。官方作品頁,CC BY 4.0。本片配樂經剪輯、音量調整與混音。

回文章列表