直接回答:中小企業的地端 AI,九成以上的需求用 7B 到 14B 的開源模型就夠了,一台 DGX Spark 等級的原廠整機就跑得動,而且還有很大餘裕。模型不是越大越好——大模型吃硬體、回應慢,而且對「查公司文件、寫制式回覆」這類工作,幫助沒有想像中大。這篇把模型大小、記憶體需求、適合幾個人用、各模型擅長什麼,整理成可以直接對照的表。
先講一件最容易誤會的事:參數大小 ≠ 好不好用
模型名稱後面的 7B、14B、70B,指的是這個模型有多大——B 是「十億」的意思,所以 7B 是 70 億、14B 是 140 億、70B 是 700 億。數字越大、模型越胖。很多人直覺認為越大越聰明,但對企業的實際應用來說,更重要的是三件事:
- 它要做什麼工作——查文件找答案,跟寫長篇分析報告,需要的模型完全不同
- 幾個人同時用——同時上線人數直接決定你要多少記憶體
- 能等多久——70B 模型在同一台機器上的回應速度,可能是 7B 的好幾倍慢
實務上,企業知識庫問答這類工作,答案準不準,主要看「有沒有找對文件」,不是模型多大。找文件那一步沒做好,換再大的模型也一樣答錯。這部分見《RAG 是什麼?為什麼 AI 知識庫都靠它》。
一張表:模型大小、要多少記憶體、適合幾個人用

下表以中度壓縮(業界常標 Q4,下一節解釋)、一般長度的對話為基準。
| 模型大小 | 需要多少記憶體 | 市面上什麼機器夠用 | 適合的工作 | 大約可服務人數 |
|---|---|---|---|---|
| 7B–8B | 約 6–8 GB | DGX Spark 等級整機輕鬆覆蓋 | 知識庫問答、制式回覆、摘要、分類 | 5–15 人 |
| 12B–14B | 約 10–12 GB | DGX Spark 等級整機輕鬆覆蓋 | 同上,理解較複雜的問句、多輪對話 | 10–30 人 |
| 32B | 約 18–24 GB | DGX Spark 等級整機輕鬆覆蓋 | 要動腦推敲的工作,例如比對合約條款、找出前後矛盾 | 5–15 人 |
| 70B | 約 35–48 GB | DGX Spark 仍能跑(128 GB 統一記憶體) | 長篇文件分析、複雜判斷 | 3–10 人 |
⚠️ 以上為常見範圍(示意),整理自公開技術資料,2026 年 8 月查詢。實際需求會因量化等級、一次對話有多長、同時幾個人在用而變動,通常還要再預留 15% 到 20% 給對話紀錄佔用的記憶體。「可服務人數」是輕度使用(非全天連續發問)的粗估,正式建置前應以實機測試為準。
🔴 為什麼我們不建議企業用遊戲卡
你一定會在別的地方看到「RTX 4090 / 5090 便宜又快」這種說法,而且價差看起來很誘人。但阿福不會建議商業客戶這樣配,兩個理由:
- 授權有明確限制。NVIDIA 的 GeForce 驅動授權條款第 2.8 條寫明「is not licensed for datacenter deployment」(不授權用於資料中心部署)。而「什麼算資料中心」官方沒有定義——公司機房就落在灰色地帶。被稽核或申請補助時這會被問到。
- 保固與服務不對等。遊戲卡是消費性產品,壞了自己送修、自己排除;原廠整機是單一供應商負責到底,對沒有 IT 人力的公司差很多。
我們的建議:從 DGX Spark 等級的原廠整機起步——可以是 NVIDIA 原廠版,也可以是 Dell、ASUS、HP、Lenovo、宏碁、技嘉、微星 等合作品牌的同規格機型。晶片與記憶體一樣,差別在儲存容量、保固服務與價格。
📄 原始資料:NVIDIA Driver License Agreement 第 2.8 條(nvidia.com/en-us/drivers/geforce-license)。該文件標示最後更新日為 2025 年 2 月 25 日,本文於 2026 年 8 月 14 日查證。條款可能隨版本改變,請以官方最新文件為準。
模型越大,回答越慢——這件事比你想的重要
很多人只看「跑不跑得動」,忽略了「要等多久」。同一台機器上,模型越大回答越慢,而且差很多。實務上只要看兩件事:

| 白話指標 | 意思 | 使用者的感受 |
|---|---|---|
| 等多久才看到第一個字 | 按下送出後,螢幕開始出現回答的等待時間 | 超過兩三秒就會覺得「是不是損壞了」 |
| 一秒吐幾個字 | 回答出現的速度 | 比人看字的速度快就好,再快感受不出來 |
大致的關係是這樣(同一台機器、同樣壓縮程度):
| 模型大小 | 回答速度 | 適合的使用情境 |
|---|---|---|
| 7B–8B | 最快,幾乎是即時的 | 客服、知識庫問答這種「人在等」的場景 |
| 12B–14B | 稍慢,但還在可接受範圍 | 同上,問題較複雜時更合用 |
| 32B | 明顯感受得到在等 | 不急的工作,例如晚上批次核對合約 |
| 70B | 慢,不適合面對面即時使用 | 丟進去跑、過一陣子再回來看結果 |
⚠️ 本表為相對關係的示意,不是實測秒數。實際速度受機器規格、壓縮程度、同時使用人數影響很大,只能用你自己的機器實測才準。本文不提供具體秒數,因為沒有經過驗證的數字可引。
實務上最常見的錯誤:為了「答得好一點」選了大模型,結果同仁嫌慢不用。一個沒人用的系統,答得再好也是零。
壓縮是什麼?為什麼它決定你需要多少記憶體
壓縮(業界叫「量化」)就是把模型瘦身——原本每一個數字都用很大的格子存,壓縮後改用小格子存,檔案變小、記憶體需求下降,代價是精確度會掉一點點。
| 壓縮程度 | 記憶體需求 | 品質 | 實務建議 |
|---|---|---|---|
| 不壓縮(常標 FP16) | 最高,約參數量 × 2 GB | 最好 | 中小企業幾乎用不到 |
| 輕度壓縮(常標 Q8) | 約參數量 × 1 GB | 幾乎無損 | 硬體有餘裕時可用 |
| 中度壓縮(常標 Q4) | 約參數量 × 0.6 GB | 多數任務感覺不出差別 | 企業實務最常用 |
換句話說:同樣 24 GB 的記憶體,不壓縮只能跑 7B,中度壓縮後能跑到 32B。所以「要準備多少記憶體」不能只看模型大小,要連壓縮一起算。而 DGX Spark 這類整機直接給 128 GB,這題基本上不用傷腦筋。
⚠️ 不是每家都這樣標。Q4、Q8 這種寫法來自 GGUF 這個格式(Ollama、llama.cpp 在用),完整標法像 Q4_K_M、Q8_0。其他格式的叫法完全不同——GPTQ、AWQ、INT8、FP8 各有一套。而且這些格式不能互換(GGUF 檔案換一個工具就讀不了)。跟廠商討論時要問清楚對方用的是哪一種,不要只說「Q4」就以為講同一件事。
我們建議的機器:原廠整機的規格長這樣
上面都在講「要多少記憶體」。實際要買什麼,我們建議直接從原廠整機起步,以 DGX Spark 為例(以下規格均取自 NVIDIA 官網,2026 年 8 月查證):
| 記憶體 | 128 GB LPDDR5x(CPU 與 GPU 共用的統一記憶體),頻寬 273 GB/s |
| 能跑多大的模型 | 官網載明:回答最大到 2000 億參數(200B);拿自家資料再訓練最大到 700 億(70B) |
| 演算能力 | 最高 1 PFLOP(FP4) |
| 儲存 | 4 TB NVMe,含自我加密 |
| 耗電 | 晶片 140 W,電源 240 W(跟一台一般桌機差不多) |
| 尺寸重量 | 15 × 15 × 5 公分,1.2 公斤(比一本雜誌大不了多少) |
| 網路 | 200 Gbps 網卡、萬兆有線網路、WiFi 7 |
| 台灣行情 | 大約十幾萬元這個級距,依品牌、儲存容量與通路而異。⚠️ 這是台灣通路與媒體報價整理的參考區間,不是 NVIDIA 官方定價,也不是我們的報價。實際金額要看你的需求規模,以正式報價為準 |
| 品牌選擇 | NVIDIA 原廠版,或 Dell Pro Max with GB10、ASUS Ascent GX10 等合作品牌。晶片與 128 GB 記憶體相同,差在儲存(例如 Dell 為 2TB、NVIDIA 原廠為 4TB)與保固服務 |
重點在那個 128 GB。一張 RTX 4090 是 24 GB,而這台機器 CPU 跟 GPU 共用 128 GB——能裝進去的模型大一個量級。上面那張表裡要雙卡 RTX 4090 才跑得動的 70B,它一台就包了。

| 自己插顯示卡 | DGX Spark 這類原廠整機 | |
|---|---|---|
| 授權 | 🔴 條款寫明不授權資料中心部署 | ✅ 無此限制 |
| 壞了誰負責 | 自己送修,各廠互推 | 單一供應商負責到底 |
| 上手難度 | 要選料、組裝、裝環境 | 插電就能用 |
| 能跑的模型大小 | 受限於顯示卡記憶體(24GB 就到 32B 左右) | 大很多(官網說回答可到 200B) |
| 耗電與散熱 | 單張 4090 就 450W 上下,機殼要夠大 | 140W,放辦公桌上就行 |
| 彈性 | 壞了換一張就好、也可以加卡 | 一體成型,不能拆 |
| 阿福的建議 | ⛔ 商業用途不建議 | 🥇 多數中小企業從這裡起步 |
誠實講一句:「彈性」那一列確實是自己插卡的優點——壞了換一張、要更強再加一張。我們還是不建議商業用途,是因為授權那一列的風險,不會因為你多買一張卡而消失。
完整的 NVIDIA 產品線分類(從巴掌大的模組到整櫃系統)見《NVIDIA 產品線怎麼分?九層地圖與中小企業選型指南》。
常見的開源模型,各自擅長什麼
以下是地端建置時常用的幾個模型家族。⚠️ 開源模型的版本更新非常快,以下描述的是各家族的定位與特性,選型時請以當下的最新版本與官方說明為準。
| 模型家族 | 來源 | 特性 | 適合的情境 |
|---|---|---|---|
| Llama | Meta | 周邊資源最齊全,工具、教學、可以問的人都最多 | 不確定要用什麼時的安全起點 |
| Qwen | 阿里巴巴 | 中文表現受關注,大小版本選擇多 | 中文文件處理為主的場景 |
| Gemma | 小型版本表現受好評,對硬體要求低 | 硬體預算緊、要跑在小機器上 | |
| DeepSeek | 深度求索 | 擅長一步一步推敲 | 要一步一步想、或跟程式有關的工作 |
| Mistral | Mistral AI | 歐洲團隊,版本精簡 | 重視歐盟法規相容性的場景 |
| TAIDE | 國科會(台灣) | 以 Llama 為基礎、針對繁體中文與在地文化強化,釋出可商用版本 | 公文、在地用語、需要「台灣味」的文字 |
⚠️ TAIDE 資訊整理自公開報導(國科會釋出,以 Llama 系列為基礎),本文查詢時未取得 2026 年的最新版本資訊,實際採用前請至官方管道確認目前版本與授權條款。
🔴 企業最容易踩的坑:授權條款
「開源」不等於「隨便你怎麼用」。各家模型的授權條款差異很大,而且企業用途的限制往往寫在細節裡。這是我們在評估階段一定會替客戶確認的一項。
簽約前務必確認這四件事:
- 能不能商用——有些模型的授權只允許研究用途
- 有沒有規模門檻——有些授權會看你公司多大、用的人多少,超過就另有規定
- 產出的東西歸誰——模型生成的內容,權利歸屬與責任如何界定
- 能不能再訓練後轉手給別人——如果你要拿自家資料再訓練一次,然後把成果賣給客戶,限制通常更嚴
下面這張表是我們在 2026 年 8 月 14 日逐一打開官方文件查證的結果,給你一個起點——但它不能取代你自己確認:
| 模型家族 | 授權名稱 | 能不能商用 | 你要注意什麼 |
|---|---|---|---|
| Llama Meta | Llama 4 Community License (2025 年 4 月 5 日生效) | ✅ 可以 | 有兩個附帶條件:①你的產品月活躍用戶超過 7 億,要另外向 Meta 申請授權;②要在網站、介面或產品文件上顯著標示「Built with Llama」 |
| Qwen 阿里巴巴 | Apache 2.0 | ✅ 可以 | 最寬鬆的一種,沒有公司規模門檻。⚠️ 但不是每個版本都一樣,下載前看那一版附的 LICENSE 檔 |
| Gemma | Gemma Terms of Use (2026 年 4 月 1 日最後修訂) | ✅ 可以 | 要遵守 Google 的「禁止用途政策」。Google 不主張你產出內容的權利,但條款也載明產出的責任由你自己承擔 |
| DeepSeek | MIT | ✅ 可以 | 官方明寫支援商用、可修改、可做衍生。⚠️ 蒸餾版跟著底座模型走(來自 Qwen 或 Llama),授權要看那一支 |
| Mistral | Apache 2.0 (Mistral 3 系列) | ✅ 可以 | ⚠️ 不是全系列都這樣——Mistral 另外有一種非商用授權(MNPL)用在部分產品上,下載前要先確認你要的那一支是哪一種 |
| TAIDE 國科會(台灣) | TAIDE 模型社群授權條款 (自訂條款) | 🟡 看版本 | 有自己的一套授權,要先同意條款才能下載。官網有標示「可商用」的版本,但要用哪一版,就得看那一版的條款 |
📄 原始資料(2026 年 8 月 14 日逐一查證):Llama 4 Community License|Qwen 官方模型卡|Gemma Terms of Use|DeepSeek-R1 官方模型卡|Mistral 3 發佈說明|TAIDE 官網
⚠️ 上表是查證當下的快照,不是永久有效的保證。授權條款真的會改——光是 Gemma 的條款,2026 年 4 月才剛修訂過一次。而且我們不提供法律意見:請以你要用的那個版本的官方授權文件為準,必要時諮詢法律專業。實務上這一關卡住的案子不少,建議在選型階段就先確認,不要等到建置完才發現不能用。
地端主機也能生圖、做影片、轉語音嗎?
可以,但硬體需求跟語言模型是兩回事,不要用同一套標準估算。
| 用途 | 地端可行性 | 硬體感受 |
|---|---|---|
| 語音轉文字(會議記錄、客服錄音) | ✅ 成熟,門檻最低 | 比語言模型輕,一般 AI 主機順帶就能做 |
| 圖片生成(商品圖、素材) | ✅ 可行 | 吃記憶體,但生一張圖不會佔用很久 |
| 影片生成 | 🟡 技術上可行,門檻高 | 算力與時間成本明顯高於前兩者,中小企業目前多半不划算 |
誠實的建議:如果你的主要目的是「把公司知識變成可以問答的系統」,不要為了「順便能生圖」而加預算買更大的機器。這兩件事的使用頻率通常差很多——知識庫是每天用,生圖可能一個月幾次,那幾次用雲端服務反而便宜。
⚠️ 本節為方向性說明。影片生成的模型與硬體門檻變動快,實際規格需依當下方案評估,本文不提供具體數字。
中小企業實務建議:從哪裡開始
- 先確定要解決的那一件事——是「找文件太慢」還是「回覆客戶太花時間」?不同答案會導向完全不同的配置
- 從 7B 到 14B 起步,先驗證流程跑得通、同事願意用
- 觀察真實使用量再決定要不要升級——多數公司會發現瓶頸在「文件沒整理好」,不在模型不夠大
- 需要更大模型時再加硬體,不要一次押到最大規格
硬體預算與整體費用見《中小企業地端 AI 完整指南》;要買什麼機器見《中小企業自建 AI 主機,要準備什麼》;地端與雲端怎麼選見《地端 AI 是什麼》。
常見問題
一定要用最新的模型嗎?
不用。企業環境更重視穩定,太新的版本工具支援不見得跟得上。實務上會挑「釋出一段時間、社群驗證過」的版本。
可以用自己的資料訓練嗎?
可以,但多數中小企業其實不需要。用 RAG 讓模型去查你的文件,成本遠低於重新訓練,而且文件更新後隔天就生效,不用重跑訓練。
模型會不會過時?那我的投資不就白費?
換模型不用換主機。模型是檔案,硬體撐得住就換得動。這也是建議一開始不要買太大的原因——真正進步快的是模型,不是硬體。
同一台主機可以跑好幾個模型嗎?
可以,但同時載入會分掉記憶體。實務上常見的做法是依需求切換,或者小模型負責量大的日常問題、大模型只拿來處理少數難題。
阿福 AI 的地端方案:一句話定位
免費評估、地端部署、軟硬體一條龍,專案規模百萬內,主要服務中部的中小企業與傳統產業。
| 服務範圍 | 需求評估、模型選型、硬體選型與採購、部署、知識庫建置、教育訓練、後續維運 |
| 價格級距 | 從輕量導入起步,完整專案規模在百萬內;實際依資料量、應用數量與硬體規格而定 |
| 適合對象 | 中小企業與中部傳產,有不能外流的資料,且沒有專職 IT 團隊 |
| 不適合 | 需要大型系統客製開發,或只想訂閱單一功能 SaaS 的公司 |
| 合作流程 | 先做免費評估,確認可行才報價簽約;評估結果若是「不建議做」也會照實說 |
最後更新:2026-08-13。表格數字整理自公開技術資料,屬常見範圍與示意,實際規格請以實機測試與官方文件為準。
不確定你的需求該配什麼規格?預約阿福 AI 的免費評估——我們會依你的應用、人數與預算給具體建議,包括「你其實不需要那麼大」這個答案。


