AI 知識

AI蒸餾是什麼?小模型不是把大模型直接縮小

你看到「蒸餾模型」,是不是以為把大模型壓成小檔案,就能帶走全部能力?先別把名字當成品質保證。

AI蒸餾又稱知識蒸餾。它的核心不是把老師的全部參數剪下來貼給學生,而是讓學生模型透過訓練,學習教師模型提供的輸出訊號。[1][2]

老師交出的不是整顆腦

把教師模型想成解題示範者、學生模型想成練習者,是方便理解的比喻,不表示模型有意識。老師提供示範,學生訓練自己的參數;「學老師怎麼判斷」也不等於能看見老師真正的內部思考。

經典分類蒸餾的一項重點,是利用老師對不同答案的機率分布,而不只留下唯一正確標籤。原論文以soft targets說明這種訓練訊號。[2]

一個不帶性能數字的例子

假設我們要辨識動物照片。只交出「這是貓」,學生收到的是單一標籤;如果教師還提供對其他動物的判斷分布,學生就有更多訓練訊號可以學。

這是教學情境,不是奧微產品功能、客戶案例或任何現行模型的實測。示範也不是事實裁判:換一張難辨識的照片,學生仍可能回答錯。

為什麼值得認識?

訓練階段和實際使用階段的需求可以不同。原始研究討論將較大型或多個模型的知識移轉到單一較小模型,讓部署形式更實用。[1][2]

但看到「更小」就直接推論「每方面一樣強」,等於跳過重要的驗證。小模型是否適合你的任務,不能只看蒸餾標籤,也不能從這篇2015研究替2026產品作性能背書。

別把蒸餾當成無損縮小

學生模型不一定能完全匹配教師。容量、訓練資料與學習目標都會影響結果。[2] 因此,本篇不承諾固定省下多少費用、所有手機都跑得動,或小模型永遠不會犯錯。

當你看到蒸餾模型的宣傳,可以先問三件事:它主要學哪種任務?測試是否接近你的使用情境?執行需要哪些資源?這是比較方式,不是選型保證;重要答案仍要核對。

一句話記住:蒸餾讓學生學老師的輸出行為,不是把老師的全部能力裝進小盒子。

來源與編輯資訊

  • [1] Google Research原始研究索引,Hinton、Vinyals、Dean,2015。
  • [2] Distilling the Knowledge in a Neural Network原論文,Introduction與Distillation章節。
  • 核對日期:2026-10-01。常青概念解說,不包裝成當日新品消息。
  • 作者:奧微軟體編輯;本文由奧微軟體開發企業社製作,含自家官網導流,不是模型廠商背書或代言。
  • 影片音樂:Carefree — Kevin MacLeod (incompetech.com),CC BY 4.0,https://creativecommons.org/licenses/by/4.0/ 。
  • 官方作品頁:https://incompetech.com/music/royalty-free/index.html?gt=&isrc=USUAN1400037
  • 本片配樂經剪輯、音量調整與混音。

更多白話AI知識,可看奧微官網BLOG。

回文章列表