硬體與本地大模型
Ollama、LM Studio、vLLM 怎麼選?免費本地 AI,最貴的常是選錯部署方式
本地大模型的第一筆冤枉錢,不一定是顯示卡,而是把試用工具當成正式服務。自己問得順,不能證明整個部門一起用也順;軟體下載不用錢,也不代表維運免費。我的結論很直接:先試模型選 LM Studio,先串應用選 Ollama,需要經營共享推論服務再評估 vLLM。這是部署建議,不是三家跑分排名。
本文查核日為 2026-10-07。價格是當日公開美元方案,不換算台幣、不含硬體、稅費或代建費用;沒有取得整機與導入報價,就不替讀者編一個總價。本文由奧微軟體整理,與三個工具供應商沒有在本文主張的代理或合作關係。
買不買:先證明本地模型能完成工作
如果只想偶爾改寫公開文案,不必因為「資料放自己家」就先買一台伺服器。先拿去識別的真實任務,驗證模型回答品質、引用來源與錯誤處理。若現有電腦已能試跑,就先用它做概念驗證。若模型根本做不好工作,換推論工具不會自動補上能力。
確實有資料邊界、離線或系統整合需求,才往本地部署走。也別把品牌名當作資料流證明:Ollama 官方提供停用雲端功能的設定;LM Studio 同時有本地與可選雲端功能。選錯模型端點或開啟外部搜尋,跟純本地推論不是同一件事。Ollama FAQ、LM Studio 定價。
怎麼選:三種工具,三種責任
LM Studio 適合先把模型試明白。圖形介面讓不想先搭服務的人可以下載模型、對話、比較輸出;模型備妥後,官方說明本地對話、文件處理與本地伺服器可以離線運作。不過它不是「只能給一個人玩的桌面工具」:官方已有 llmster,能不用圖形介面跑背景服務。是否適合正式上線,仍要驗證你的應用與管理需求。離線文件、無介面服務。
Ollama 適合先把模型接進程式與工作流程。它有模型管理、API 與併發設定;不要誤寫成完全不能多人用。但同一模型的平行請求會增加上下文記憶體配置,因此「單人能跑」不能直接推論成「四人同時長文問答也夠」。採購前先問輸入多長、同時多少請求,再決定記憶體,而不是只看模型檔案大小。官方 FAQ。
vLLM 適合有工程人員維護、要把推論當共享服務的團隊。專案列出連續批次處理、PagedAttention 與前綴快取等功能,另有線上服務及離線吞吐壓測工具。這些是評估服務效能的工具,不是保證它在每一台機器、每一種量化模型都贏。安裝相容性、模型支援、驅動與版本回復都要列進交付範圍。vLLM 專案、Benchmark CLI。
規格、價格與效能對照
下表全部於 2026-10-07 查核;「本地費用」只指工具取得或基本本地方案,不含模型授權與設備。效能欄是驗收方向,沒有同條件實測數字就不填速度排名。
| 項目 | Ollama | LM Studio | vLLM |
|---|---|---|---|
| 本地工具價格 | Free US$0,本地自有硬體使用不計雲端用量 | Free US$0,包含本地模型功能 | 開源專案,本身不收授權購買費 |
| 另外公開的雲端方案 | Pro US$20/月、Max US$100/月;不是本地必付費 | Bionic+ US$20/月、Pro US$100/月;可選雲端功能 | 本文未比較代管商報價 |
| 介面與服務規格 | 模型管理、API、平行請求設定 | 桌面操作、本地伺服器、llmster 無介面服務 | 推論與服務引擎、連續批次、壓測工具 |
| 首先驗的效能 | 冷啟動、長上下文及併發記憶體 | 選定模型的回答品質與互動等待 | 首 token 延遲、尾端延遲與負載下吞吐 |
| 同條件 tokens/s | 本輪未實測,不作排名 | 本輪未實測,不作排名 | 本輪未實測,不作排名 |
| 採購建議 | 先串既有應用 | 先試模型與操作流程 | 有維運能力再評估共享服務 |
價格來源:Ollama 公開方案、LM Studio 公開方案。開源授權來源:Ollama MIT、vLLM Apache-2.0。工具授權不取代模型權重的使用條款;選到哪個模型,就另外核對哪個模型的商用範圍。
效能:別拿兩張不相干的跑分圖買設備
一次只問短句、一次塞長文件;一次單請求、一次整批處理;一次冷啟動、一次已暖機,這些數字不能混成「快幾倍」。vLLM 文件也提醒不同工具的延遲名稱未必同義,應比較量測點與公式。首 token 延遲是送出請求到第一段串流輸出的等待,與整段回答完成時間不同。量測定義。
建議採購驗收先固定模型版本、量化方式、硬體、上下文與取樣設定,再用同一批題目比較。教學測試可以從一人、四人、八個同時請求逐級增加,記錄首 token、整段完成時間、失敗率與記憶體峰值;這是建議測試設計,不是本文已跑出的成績。長文件任務再另測,不能用短對話結果代替。
花多少:先買驗收,再買擴充
預算應分四筆:設備、導入、維運、可選雲端用量。Ollama 與 LM Studio 的 US$20、US$100 方案是公開雲端產品價格,不是部署到公司電腦必須繳的月費;vLLM 沒有工具購買費,也不是有人免費幫你監控、升級與排障。整機及導入費用以經銷或服務報價為準,要求報價寫清楚配置、稅費、保固與工作範圍。
不要先追求最高併發。先讓一個真正有用的流程穩定運作,再按尖峰負載擴充。找人導入時,要求交回模型與設定版本、啟停方法、權限、監控、更新與回復流程,並用上述同條件測試驗收。只交一張「跑起來了」截圖,不能算部署完成。
我的結論
還在找可用模型,先用 LM Studio;已知道任務、想接到自己的程式,先用 Ollama;有持續服務需求與維運人員,再讓 vLLM 進入評選。不必因為大家都提某個框架就一次重建整套環境。真正該買的是可驗收、能交接的流程,不是軟體名稱。
奧微軟體可協助釐清 AI 應用與既有系統的串接需求;討論前先整理任務、資料範圍、預算與驗收條件,再決定適合的導入方式。與奧微討論需求。
