硬體與本地大模型
RTX 4090 24GB、RTX 6000 48GB、RTX PRO 6000 96GB 怎麼選?模型放得下,長文件未必跑得動
查核與更新日期:2026-10-09。作者:奧微軟體開發企業社。本文整理公開價格、第三方生成速度與容量估算;公開實測不是奧微自行測得,也不是任何型號的效能保證。
買本地 AI 顯卡,最容易買錯的不是品牌,而是只算模型檔案。展示時一個人問一句話很順,上線後四個人同時丟長文件,卻可能吃光顯示記憶體。24GB、48GB、96GB 的差別,不只是能裝多大的模型,更是裝完之後還剩多少空間。
我的結論很直接:需求還沒量清楚,先別買最大張;確定要長文件或多人服務,也別拿「模型能載入」當採購驗收。先固定模型、量化、文件長度與同時使用人數,再挑顯卡。
三種容量,先看這張採購表
下表是容量級距的具名例子,不是同價位競賽。規格來自 NVIDIA 官方;最大功耗是顯卡規格上限,不是整機耗電或實際推論用電。價格是公開掛價參考,不是成交價或現貨保證。
| 採購項目 | RTX 4090 | RTX 6000 Ada Generation | RTX PRO 6000 Blackwell Workstation Edition |
|---|---|---|---|
| 顯示記憶體 | 24GB GDDR6X | 48GB GDDR6 ECC | 96GB GDDR7 ECC |
| 官方最大功耗 | 450W | 300W | 600W |
| 台灣公開掛價參考,2026-10-09 查閱 | NT$59,990~69,990,蝦皮賣場比價索引,原賣場庫存待確認 | NT$305,000,Yahoo 商品頁顯示售完補貨中 | NT$585,000,光華商城工作站卡商品頁掛價 |
| 容量判斷 | 較小模型、單人短上下文先評估;32B 級需算完整預算 | 32B 級留較多上下文空間;70B 級常見 4bit 仍須核餘裕 | 較大模型與較多快取的容量選項,不等於吞吐保證 |
4090 的區間取自飛比收錄的蝦皮賣場,例如 MSI GAMING SLIM 24G 為 59,990 元、GAMING X SLIM 24G 為 69,990 元;這是比價索引,不把它冒稱已直接核到賣場庫存。48GB 為 Yahoo 的 RTX 6000 Ada 商品頁,96GB 為光華商城的 RTX PRO 6000 Blackwell 工作站商品頁。三者是不同品牌與供貨條件的單卡掛價;沒有用二手價、混型號選項或整機價格湊區間。
這是三款不同世代與定位的卡;96GB 不是 24GB 的四倍生成速度。RTX 4090 官方也列沒有 NVLink,不能把多買一張理解成自動合併顯示記憶體。跨卡切分仍要看推論框架、模型與主機條件。
生成速度:公開實測有數字,但要看測的是什麼
llama.cpp 社群 CUDA 榜單提供三款 GPU 的生成速度參考。以下統一取 Llama 2 7B、Q4_0 量化、CUDA、關閉 Flash Attention、tg128 測項;tg128 是生成 128 個 token 的測試,不是每秒處理提示詞的 pp512。
| 榜單 GPU 名稱 | 公開生成速度,tokens/s | llama.cpp commit |
|---|---|---|
| RTX 4090 | 186.21 | 2241453 |
| RTX 6000 Ada | 176.07 | b8e09f0 |
| RTX PRO 6000 Blackwell | 274.20 | 79c1160 |
這是不同投稿者、主機與軟體版本的社群實測,不是三卡在同一台主機的受控比較。PRO 6000 榜單名稱未另標 Workstation、Max-Q 或 Server 版本,因此 274.20 不當成上表 600W Workstation Edition 的專用實測。數字僅供了解小模型速度量級,不能外推為 Qwen3-32B、70B、長文件或四人服務的速度。
對採購最有用的提醒是:這組小模型數字中,48GB 的 Ada 並沒有比 24GB 的 4090 快。多花的錢可能是買容量餘裕、ECC 或工作站需求,不是買線性加速;先確認你的瓶頸是放不下,還是生成太慢。
第一筆帳:權重只是下限
最粗的權重預算是「參數量乘上每個參數的位元數,再除以八」。Qwen 官方列 Qwen3-32B 實際有 32.8B 參數:理想全權重 4bit 約 16.4GB、8bit 約 32.8GB、16bit 約 65.6GB。這些不是下載檔案大小,也還沒加量化比例尺、未量化張量、執行工作區與快取。
同樣拿名義 70B 的密集模型做算式,理想 4bit 權重下限就是 35GB。因此一般 4bit 70B 全部放在單張 24GB GPU,不該被當成合理預設。CPU 分攤或不同壓縮方式可能改變能否執行,但那是另一套容量與速度條件,不能藏在一句「可跑 70B」裡。
本文 GB 是十進位十億位元組,GiB 是二進位單位;16.4GB 約 15.27GiB。估算時要和工具回報的單位對齊,再看實際可用空間,不能把標示容量全部拿去塞模型。
第二筆帳:長文件與四個人,不會免費
模型生成時會保留先前 token 的 KV cache,也就是注意力機制的鍵和值。量化了模型權重,不代表 KV cache 也自動變成 4bit。快取通常會隨累積 token 增加,實際策略則依框架與模型而異。
用 Qwen3-32B 官方設定的 64 層、8 個 KV heads、每頭 128 維,假設 KV 採 16bit、完整儲存且沒有共用或壓縮,估算式是「2 × 64 × 8 × 128 × 2 bytes × token 數 × 請求數」。一個請求累積 8,192 tokens,KV 約 2GiB;累積 32,768 tokens,約 8GiB。四個各 8,192 tokens 的獨立請求,也約 8GiB。
把理想 4bit 權重 15.27GiB 加上這筆 8GiB,已約 23.27GiB,其他開銷還沒算。這不是實測爆記憶體的宣告,而是提醒:24GB 級距即使載得進 32B,長文件或多人服務也不能先答應一定夠。這些 token 長度是教學情境,不是模型最大上下文的宣稱。
快取量化、CPU offload 或共用前綴可能省 GPU 空間,代價與效果要實測。不能把省下的容量直接換算成固定加速倍數。
買不買、怎麼選:買能驗收的工作量
單人測試、文件短,而且較小模型已能回答工作問題,先評估 24GB 級距,別為參數量面子買 96GB。採購前必須用預定的量化檔,確認品質和完整記憶體峰值。
32B 級模型要長上下文或多個請求,48GB 比只盯 24GB 更值得列入評估;但這是容量餘裕的判斷,不是承諾四人都快。若指定更大模型、更多同時請求,再考慮 96GB;如果瓶頸其實是回應時間,容量加倍也未必解決。
請供應商用同一模型版本、量化檔與框架,測短文件、長文件,以及單人、四人情境。記錄首個 token 等多久、完整回答多久、尖峰顯示記憶體與失敗請求;尤其要看長文件與排隊時的延遲,而不是只挑漂亮的平均 tokens/s。公開 benchmark 是篩選起點,不能代替你的工作量驗收。
花多少:要的是整機含稅報價
單卡預算先抓量級:本輪公開掛價中,4090 約 6~7 萬元、6000 Ada 約 30.5 萬元、PRO 6000 工作站卡約 58.5 萬元。這些是詢價參考,不是台灣市場均價;4090 尚須核原賣場價格與庫存,Ada 頁面明示補貨中。下單前重新確認含稅、公司貨、保固、交期與現貨,96GB 要寫清楚 Workstation Edition,不能混用其他版本。
把卡、主機、電源、系統記憶體、SSD、散熱、保固與部署費用一起列出;同時要求報價註明新舊品、含稅與否、交期和驗收工作量。最大功耗只幫忙檢查供電與散熱,不能直接當每月電費。便宜但跑不過你的長文件測試,才是真正花錯錢。
採購順序應該是「工作量、可用容量、延遲,再談價格」。不要為了宣傳頁的最大參數量,替一個尚未驗證的使用情境付款。
來源與限制
- NVIDIA RTX 4090 官方規格。
- NVIDIA RTX 6000 Ada 官方規格。
- NVIDIA RTX PRO 6000 Blackwell Workstation Edition。
- Qwen3-32B 官方模型卡與官方設定。
- Transformers 官方 KV cache 說明。
以上規格及文內價格、公開 benchmark 連結均於 2026-10-09 查閱。價格可能變動;社群 benchmark 並非當日新測。容量算式是條件化教學估算,奧微未做實機、品質評測或商用授權審查;不保證任一模型配置可執行,不把 ECC 或本地部署當成安全保證。
若要把本地 AI 接進既有網站、後台或企業流程,奧微軟體可協助整理 AI 應用與系統串接需求;先談工作量、資料邊界、預算與驗收條件,再評估導入。本文由奧微撰寫並含自家服務連結,不代表奧微製造上述顯卡,也不是客戶實測案例。
