地端 AI 要選哪個模型?開源 LLM 選型與硬體對照表【2026】

直接回答:中小企業的地端 AI,九成以上的需求用 7B 到 14B 的開源模型就夠了,一台 DGX Spark 等級的原廠整機就跑得動,而且還有很大餘裕。模型不是越大越好——大模型吃硬體、回應慢,而且對「查公司文件、寫制式回覆」這類工作,幫助沒有想像中大。這篇把模型大小、記憶體需求、適合幾個人用、各模型擅長什麼,整理成可以直接對照的表。

先講一件最容易誤會的事:參數大小 ≠ 好不好用

模型名稱後面的 7B、14B、70B,指的是這個模型有多大——B 是「十億」的意思,所以 7B 是 70 億、14B 是 140 億、70B 是 700 億。數字越大、模型越胖。很多人直覺認為越大越聰明,但對企業的實際應用來說,更重要的是三件事:

  • 它要做什麼工作——查文件找答案,跟寫長篇分析報告,需要的模型完全不同
  • 幾個人同時用——同時上線人數直接決定你要多少記憶體
  • 能等多久——70B 模型在同一台機器上的回應速度,可能是 7B 的好幾倍慢

實務上,企業知識庫問答這類工作,答案準不準,主要看「有沒有找對文件」,不是模型多大。找文件那一步沒做好,換再大的模型也一樣答錯。這部分見《RAG 是什麼?為什麼 AI 知識庫都靠它》。

一張表:模型大小、要多少記憶體、適合幾個人用

模型大小對照圖:7B 到 70B 各需要多少記憶體、大約可服務幾人、回答速度快慢與適合的工作,以及原廠整機是否覆蓋得到

下表以中度壓縮(業界常標 Q4,下一節解釋)、一般長度的對話為基準。

模型大小需要多少記憶體市面上什麼機器夠用適合的工作大約可服務人數
7B–8B約 6–8 GBDGX Spark 等級整機輕鬆覆蓋知識庫問答、制式回覆、摘要、分類5–15 人
12B–14B約 10–12 GBDGX Spark 等級整機輕鬆覆蓋同上,理解較複雜的問句、多輪對話10–30 人
32B約 18–24 GBDGX Spark 等級整機輕鬆覆蓋要動腦推敲的工作,例如比對合約條款、找出前後矛盾5–15 人
70B約 35–48 GBDGX Spark 仍能跑(128 GB 統一記憶體)長篇文件分析、複雜判斷3–10 人

⚠️ 以上為常見範圍(示意),整理自公開技術資料,2026 年 8 月查詢。實際需求會因量化等級、一次對話有多長、同時幾個人在用而變動,通常還要再預留 15% 到 20% 給對話紀錄佔用的記憶體。「可服務人數」是輕度使用(非全天連續發問)的粗估,正式建置前應以實機測試為準

🔴 為什麼我們不建議企業用遊戲卡

你一定會在別的地方看到「RTX 4090 / 5090 便宜又快」這種說法,而且價差看起來很誘人。但阿福不會建議商業客戶這樣配,兩個理由:

  1. 授權有明確限制。NVIDIA 的 GeForce 驅動授權條款第 2.8 條寫明「is not licensed for datacenter deployment」(不授權用於資料中心部署)。而「什麼算資料中心」官方沒有定義——公司機房就落在灰色地帶。被稽核或申請補助時這會被問到。
  2. 保固與服務不對等。遊戲卡是消費性產品,壞了自己送修、自己排除;原廠整機是單一供應商負責到底,對沒有 IT 人力的公司差很多。

我們的建議:從 DGX Spark 等級的原廠整機起步——可以是 NVIDIA 原廠版,也可以是 Dell、ASUS、HP、Lenovo、宏碁、技嘉、微星 等合作品牌的同規格機型。晶片與記憶體一樣,差別在儲存容量、保固服務與價格。

📄 原始資料:NVIDIA Driver License Agreement 第 2.8 條(nvidia.com/en-us/drivers/geforce-license)。該文件標示最後更新日為 2025 年 2 月 25 日,本文於 2026 年 8 月 14 日查證。條款可能隨版本改變,請以官方最新文件為準。

模型越大,回答越慢——這件事比你想的重要

很多人只看「跑不跑得動」,忽略了「要等多久」。同一台機器上,模型越大回答越慢,而且差很多。實務上只要看兩件事:

模型越大回答越慢的趨勢圖:7B 到 8B 幾乎即時,12B 到 14B 稍慢但可接受,32B 感覺得到在等,70B 明顯要等
白話指標意思使用者的感受
等多久才看到第一個字按下送出後,螢幕開始出現回答的等待時間超過兩三秒就會覺得「是不是損壞了」
一秒吐幾個字回答出現的速度比人看字的速度快就好,再快感受不出來

大致的關係是這樣(同一台機器、同樣壓縮程度):

模型大小回答速度適合的使用情境
7B–8B最快,幾乎是即時的客服、知識庫問答這種「人在等」的場景
12B–14B稍慢,但還在可接受範圍同上,問題較複雜時更合用
32B明顯感受得到在等不急的工作,例如晚上批次核對合約
70B慢,不適合面對面即時使用丟進去跑、過一陣子再回來看結果

⚠️ 本表為相對關係的示意不是實測秒數。實際速度受機器規格、壓縮程度、同時使用人數影響很大,只能用你自己的機器實測才準。本文不提供具體秒數,因為沒有經過驗證的數字可引。

實務上最常見的錯誤:為了「答得好一點」選了大模型,結果同仁嫌慢不用。一個沒人用的系統,答得再好也是零。

壓縮是什麼?為什麼它決定你需要多少記憶體

壓縮(業界叫「量化」)就是把模型瘦身——原本每一個數字都用很大的格子存,壓縮後改用小格子存,檔案變小、記憶體需求下降,代價是精確度會掉一點點。

壓縮程度記憶體需求品質實務建議
不壓縮(常標 FP16)最高,約參數量 × 2 GB最好中小企業幾乎用不到
輕度壓縮(常標 Q8)約參數量 × 1 GB幾乎無損硬體有餘裕時可用
中度壓縮(常標 Q4)約參數量 × 0.6 GB多數任務感覺不出差別企業實務最常用

換句話說:同樣 24 GB 的記憶體,不壓縮只能跑 7B,中度壓縮後能跑到 32B。所以「要準備多少記憶體」不能只看模型大小,要連壓縮一起算。而 DGX Spark 這類整機直接給 128 GB,這題基本上不用傷腦筋。

⚠️ 不是每家都這樣標。Q4、Q8 這種寫法來自 GGUF 這個格式(Ollama、llama.cpp 在用),完整標法像 Q4_K_M、Q8_0。其他格式的叫法完全不同——GPTQAWQINT8FP8 各有一套。而且這些格式不能互換(GGUF 檔案換一個工具就讀不了)。跟廠商討論時要問清楚對方用的是哪一種,不要只說「Q4」就以為講同一件事。

我們建議的機器:原廠整機的規格長這樣

上面都在講「要多少記憶體」。實際要買什麼,我們建議直接從原廠整機起步,以 DGX Spark 為例(以下規格均取自 NVIDIA 官網,2026 年 8 月查證):

記憶體128 GB LPDDR5x(CPU 與 GPU 共用的統一記憶體),頻寬 273 GB/s
能跑多大的模型官網載明:回答最大到 2000 億參數(200B);拿自家資料再訓練最大到 700 億(70B)
演算能力最高 1 PFLOP(FP4)
儲存4 TB NVMe,含自我加密
耗電晶片 140 W,電源 240 W(跟一台一般桌機差不多)
尺寸重量15 × 15 × 5 公分,1.2 公斤(比一本雜誌大不了多少)
網路200 Gbps 網卡、萬兆有線網路、WiFi 7
台灣行情大約十幾萬元這個級距,依品牌、儲存容量與通路而異。⚠️ 這是台灣通路與媒體報價整理的參考區間不是 NVIDIA 官方定價,也不是我們的報價。實際金額要看你的需求規模,以正式報價為準
品牌選擇NVIDIA 原廠版,或 Dell Pro Max with GB10、ASUS Ascent GX10 等合作品牌。晶片與 128 GB 記憶體相同,差在儲存(例如 Dell 為 2TB、NVIDIA 原廠為 4TB)與保固服務

重點在那個 128 GB。一張 RTX 4090 是 24 GB,而這台機器 CPU 跟 GPU 共用 128 GB——能裝進去的模型大一個量級。上面那張表裡要雙卡 RTX 4090 才跑得動的 70B,它一台就包了。

自己插顯示卡與 DGX Spark 原廠整機的對照:授權、壞了誰負責、能跑多大的模型、記憶體、耗電,以及阿福建議哪一條
自己插顯示卡DGX Spark 這類原廠整機
授權🔴 條款寫明不授權資料中心部署✅ 無此限制
壞了誰負責自己送修,各廠互推單一供應商負責到底
上手難度要選料、組裝、裝環境插電就能用
能跑的模型大小受限於顯示卡記憶體(24GB 就到 32B 左右)大很多(官網說回答可到 200B)
耗電與散熱單張 4090 就 450W 上下,機殼要夠大140W,放辦公桌上就行
彈性壞了換一張就好、也可以加卡一體成型,不能拆
阿福的建議⛔ 商業用途不建議🥇 多數中小企業從這裡起步

誠實講一句:「彈性」那一列確實是自己插卡的優點——壞了換一張、要更強再加一張。我們還是不建議商業用途,是因為授權那一列的風險,不會因為你多買一張卡而消失

完整的 NVIDIA 產品線分類(從巴掌大的模組到整櫃系統)見《NVIDIA 產品線怎麼分?九層地圖與中小企業選型指南》。

常見的開源模型,各自擅長什麼

以下是地端建置時常用的幾個模型家族。⚠️ 開源模型的版本更新非常快,以下描述的是各家族的定位與特性,選型時請以當下的最新版本與官方說明為準

模型家族來源特性適合的情境
LlamaMeta周邊資源最齊全,工具、教學、可以問的人都最多不確定要用什麼時的安全起點
Qwen阿里巴巴中文表現受關注,大小版本選擇多中文文件處理為主的場景
GemmaGoogle小型版本表現受好評,對硬體要求低硬體預算緊、要跑在小機器上
DeepSeek深度求索擅長一步一步推敲要一步一步想、或跟程式有關的工作
MistralMistral AI歐洲團隊,版本精簡重視歐盟法規相容性的場景
TAIDE國科會(台灣)以 Llama 為基礎、針對繁體中文與在地文化強化,釋出可商用版本公文、在地用語、需要「台灣味」的文字

⚠️ TAIDE 資訊整理自公開報導(國科會釋出,以 Llama 系列為基礎),本文查詢時未取得 2026 年的最新版本資訊,實際採用前請至官方管道確認目前版本與授權條款

🔴 企業最容易踩的坑:授權條款

「開源」不等於「隨便你怎麼用」。各家模型的授權條款差異很大,而且企業用途的限制往往寫在細節裡。這是我們在評估階段一定會替客戶確認的一項。

簽約前務必確認這四件事:

  • 能不能商用——有些模型的授權只允許研究用途
  • 有沒有規模門檻——有些授權會看你公司多大、用的人多少,超過就另有規定
  • 產出的東西歸誰——模型生成的內容,權利歸屬與責任如何界定
  • 能不能再訓練後轉手給別人——如果你要拿自家資料再訓練一次,然後把成果賣給客戶,限制通常更嚴

下面這張表是我們在 2026 年 8 月 14 日逐一打開官方文件查證的結果,給你一個起點——但它不能取代你自己確認

模型家族授權名稱能不能商用你要注意什麼
Llama
Meta
Llama 4 Community License
(2025 年 4 月 5 日生效)
✅ 可以有兩個附帶條件:①你的產品月活躍用戶超過 7 億,要另外向 Meta 申請授權;②要在網站、介面或產品文件上顯著標示「Built with Llama」
Qwen
阿里巴巴
Apache 2.0✅ 可以最寬鬆的一種,沒有公司規模門檻。⚠️ 但不是每個版本都一樣,下載前看那一版附的 LICENSE 檔
Gemma
Google
Gemma Terms of Use
(2026 年 4 月 1 日最後修訂)
✅ 可以要遵守 Google 的「禁止用途政策」。Google 不主張你產出內容的權利,但條款也載明產出的責任由你自己承擔
DeepSeekMIT✅ 可以官方明寫支援商用、可修改、可做衍生。⚠️ 蒸餾版跟著底座模型走(來自 Qwen 或 Llama),授權要看那一支
MistralApache 2.0
(Mistral 3 系列)
✅ 可以⚠️ 不是全系列都這樣——Mistral 另外有一種非商用授權(MNPL)用在部分產品上,下載前要先確認你要的那一支是哪一種
TAIDE
國科會(台灣)
TAIDE 模型社群授權條款
(自訂條款)
🟡 看版本有自己的一套授權,要先同意條款才能下載。官網有標示「可商用」的版本,但要用哪一版,就得看那一版的條款

📄 原始資料(2026 年 8 月 14 日逐一查證)Llama 4 Community LicenseQwen 官方模型卡Gemma Terms of UseDeepSeek-R1 官方模型卡Mistral 3 發佈說明TAIDE 官網

⚠️ 上表是查證當下的快照,不是永久有效的保證。授權條款真的會改——光是 Gemma 的條款,2026 年 4 月才剛修訂過一次。而且我們不提供法律意見請以你要用的那個版本的官方授權文件為準,必要時諮詢法律專業。實務上這一關卡住的案子不少,建議在選型階段就先確認,不要等到建置完才發現不能用。

地端主機也能生圖、做影片、轉語音嗎?

可以,但硬體需求跟語言模型是兩回事,不要用同一套標準估算。

用途地端可行性硬體感受
語音轉文字(會議記錄、客服錄音)✅ 成熟,門檻最低比語言模型輕,一般 AI 主機順帶就能做
圖片生成(商品圖、素材)✅ 可行吃記憶體,但生一張圖不會佔用很久
影片生成🟡 技術上可行,門檻高算力與時間成本明顯高於前兩者,中小企業目前多半不划算

誠實的建議:如果你的主要目的是「把公司知識變成可以問答的系統」,不要為了「順便能生圖」而加預算買更大的機器。這兩件事的使用頻率通常差很多——知識庫是每天用,生圖可能一個月幾次,那幾次用雲端服務反而便宜。

⚠️ 本節為方向性說明。影片生成的模型與硬體門檻變動快,實際規格需依當下方案評估,本文不提供具體數字

中小企業實務建議:從哪裡開始

  1. 先確定要解決的那一件事——是「找文件太慢」還是「回覆客戶太花時間」?不同答案會導向完全不同的配置
  2. 從 7B 到 14B 起步,先驗證流程跑得通、同事願意用
  3. 觀察真實使用量再決定要不要升級——多數公司會發現瓶頸在「文件沒整理好」,不在模型不夠大
  4. 需要更大模型時再加硬體,不要一次押到最大規格

硬體預算與整體費用見《中小企業地端 AI 完整指南》;要買什麼機器見《中小企業自建 AI 主機,要準備什麼》;地端與雲端怎麼選見《地端 AI 是什麼》。

常見問題

一定要用最新的模型嗎?

不用。企業環境更重視穩定,太新的版本工具支援不見得跟得上。實務上會挑「釋出一段時間、社群驗證過」的版本。

可以用自己的資料訓練嗎?

可以,但多數中小企業其實不需要。用 RAG 讓模型去查你的文件,成本遠低於重新訓練,而且文件更新後隔天就生效,不用重跑訓練。

模型會不會過時?那我的投資不就白費?

換模型不用換主機。模型是檔案,硬體撐得住就換得動。這也是建議一開始不要買太大的原因——真正進步快的是模型,不是硬體。

同一台主機可以跑好幾個模型嗎?

可以,但同時載入會分掉記憶體。實務上常見的做法是依需求切換,或者小模型負責量大的日常問題、大模型只拿來處理少數難題。

阿福 AI 的地端方案:一句話定位

免費評估、地端部署、軟硬體一條龍,專案規模百萬內,主要服務中部的中小企業與傳統產業。

服務範圍需求評估、模型選型、硬體選型與採購、部署、知識庫建置、教育訓練、後續維運
價格級距從輕量導入起步,完整專案規模在百萬內;實際依資料量、應用數量與硬體規格而定
適合對象中小企業與中部傳產,有不能外流的資料,且沒有專職 IT 團隊
不適合需要大型系統客製開發,或只想訂閱單一功能 SaaS 的公司
合作流程先做免費評估,確認可行才報價簽約;評估結果若是「不建議做」也會照實說

最後更新:2026-08-13。表格數字整理自公開技術資料,屬常見範圍與示意,實際規格請以實機測試與官方文件為準。


不確定你的需求該配什麼規格?預約阿福 AI 的免費評估——我們會依你的應用、人數與預算給具體建議,包括「你其實不需要那麼大」這個答案。

繼續讀下去

目錄

不確定從哪開始?

一次免費的可行性評估,誠實告訴你能做、不能做、值不值得做。

預約免費評估

想把這篇的做法用在你公司?

一次免費的可行性評估,告訴你能做、不能做、值不值得做。