AI 知識
Open weights 不等於本地可跑
一個 AI 模型宣布開放權重,很容易讓人產生直覺:既然檔案可以下載,那我應該也能把它裝進自己的電腦。
但拿得到和跑得動,是兩個完全不同的問題。
Thinking Machines Lab 公開的 Inkling,正好提供了一個很具體的例子。這個模型採 Mixture-of-Experts 架構,總參數量是 975B,每次處理 token 時約有 41B 參數參與運算。官方提供 BF16 與 NVFP4 權重,也列出多種本地推理框架。
然而,官方 BF16 repository 的實際容量接近 1.9 TB。即使授權允許、檔案可下載,一般電腦仍不會因此突然具備部署它的硬體條件。
41B active,不代表只需要 41B 權重
MoE 模型可以想成一個擁有許多專家的系統。每次收到 token,路由器不會讓所有專家都一起工作,而是挑出其中一部分參與計算。
這就是 active parameters 的意義:它主要描述一次推理實際使用多少參數做運算。
但沒有在這一個 token 上被選中的專家,不等於從模型裡消失。下一個 token 可能會被送往不同專家,因此推理系統仍要能存取完整的專家權重。
換句話說,41B active 可以降低單次計算量,卻不能直接被翻譯成只需下載 41B,或 41B VRAM 就能跑。總參數與啟用參數回答的是不同問題。
為什麼 BF16 權重會接近 2 TB?
BF16 用 16 bits,也就是 2 bytes,表示一個參數。
如果只做最簡單的紙上計算:
9750 億個參數乘上 2 bytes,大約是 1.95 TB。
Hugging Face 官方 API 顯示,Inkling BF16 repository 實際使用約 1.90 TB 儲存空間,與這個粗估落在同一量級。
這還只是權重檔案。真正執行模型時,還要考慮推理引擎、記憶體配置、KV cache、activation、輸入長度、批次大小與系統保留空間。檔案塞得進硬碟,不等於模型塞得進 VRAM,更不等於能用可接受的速度產生答案。
壓成 4-bit,就能放進一般電腦嗎?
量化確實能大幅降低容量。
如果只把 975B 個權重都當成 4 bits 計算,紙上最低資料量約為 487.5 GB。這已比 BF16 小很多,但仍遠高於一般消費級顯示卡的 VRAM。
而且 487.5 GB 只是理想化的權重位元數。實際格式還會包含量化 scale、metadata 與其他資料;執行時也仍需要 runtime、KV cache 與額外工作空間。
透過多 GPU、分散式推理、CPU offload 或更激進的量化,可以繼續降低單一裝置負擔,但代價可能是更慢的速度、更複雜的系統、更多硬體或精度損失。量化改變的是取捨,不是把基礎設施需求變成零。
Open weights 到底開放了什麼?
Open weights 最直接的意思,是模型權重可以被取得。這通常讓研究者與開發者有機會自行部署、測試、微調或分析模型,而不是只能透過封閉 API 使用。
但它不必然代表完整訓練資料、訓練程式、資料處理流程與所有開發細節都公開,也不代表任何用途都不受授權限制。
因此,判斷一個模型是否真的適合自行部署,至少要分開看四層:
- 取得:權重是否真的可以下載?
- 授權:你的研究、產品或商業用途是否被允許?
- 工具:推理框架、量化格式與硬體是否相容?
- 資源:儲存、VRAM、RAM、頻寬與速度是否足夠?
只通過第一層,不代表後面三層會自動成立。
看到大型開放模型,先看這五個數字
模型新聞通常會把能力、benchmark 與參數規模放在最醒目的地方。但如果你在意的是自行部署,還應該先找五項資訊:
- total parameters:完整模型到底有多大;
- active parameters:每次推理實際啟用多少參數;
- weight precision:BF16、FP8、4-bit 或其他格式;
- repository size:實際要下載與保存多少檔案;
- deployment requirements:官方支援哪些框架與硬體配置。
這五項資訊放在一起,才比較接近真正的部署成本。
Open weights 很重要,因為它讓更多人能檢查、研究與改造模型。但開放權重拆掉的主要是取得門檻,不一定會拆掉硬體門檻。
當模型規模來到數千億甚至兆級參數,可以下載仍然只是起點。真正決定你能不能使用它的,往往不是下載按鈕,而是下載之後那一整套計算與記憶體現實。
查證摘要
- Inkling 為 975B total、41B active 的 MoE 模型,提供 BF16 與 NVFP4 權重。
- Hugging Face 官方 API 顯示,BF16 repository 使用約 1.90 TB 儲存空間。
- 41B active 描述每個 token 的部分運算規模,不能直接當成完整權重容量或最低 VRAM。
- 975B 權重若只按 4-bit 做紙上計算,約為 487.5 GB;實際部署還有量化與 runtime overhead。
- 能否自行部署仍取決於授權、推理框架、精度、儲存、記憶體、頻寬與可接受速度。
