Qwen3.8-Max 與 Qwen3.8-27B 差了 25 倍,我們選錯過一次
林政賢 ·
這篇文章的第一版,我們差點叫讀者去下載一顆 2.4 兆參數的模型裝在遊戲電腦上。發現的時候距離發布只剩三十秒。所以這篇從「我們怎麼選錯」開始講。
為什麼名字裡有「Max」的模型,不該裝上你的遊戲電腦
命名這件事,廠商從來不是為了方便你判斷能不能跑,是為了排出產品線的高低。「Max」「Ultra」「Pro」代表的是這家公司陣容裡最頂規的那顆——參數最多、能力最強,同時也最不可能塞進一張消費級顯卡。
Qwen3.8-Max 就是這樣:阿里巴巴 2026 年 8 月 2 日發表,2.4 兆參數的 MoE 模型,每次推論啟用約 950 億參數,上下文最長 100 萬 tokens。這種東西本來就是設計給機房、給一整排伺服器跑的。一週內官方連權重都開放了,但開放權重不等於你家跑得動。
問題是這些名字太吸引人,會讓人下意識覺得「既然都要在自己電腦上跑模型了,當然選最強的」。這個直覺是錯的。本地端能不能跑,跟模型強不強一點關係都沒有,只跟一件事有關:檔案塞不塞得進你的 VRAM。
所以規矩很簡單,只認兩個數字:
前者小於等於後者,才有資格談下一步。參數量、跑分、官網文案寫得多漂亮,這些在本地端全部是雜訊——看了只會讓你選錯,不會幫你選對。
你的顯卡有幾 GB,決定你能跑哪個版本
真正該看的是 Qwen3.8-27B:2026 年 8 月 14 日開放權重,277.8 億參數的稠密(dense)模型,Apache 2.0 授權,原生支援圖片與影片輸入,上下文 262,144 tokens。這是第一次 Qwen-Max 等級的能力被放進一顆消費級顯卡跑得動的尺寸裡。
27B 本身還分好幾個壓縮版本,對應不同的 VRAM。以我們 8 月底在下載頁看到的檔案大小:
24GB 顯卡 → Q4_K_M,檔案 17.11 GB
20GB 顯卡 → Q4_K_S,檔案 16.12 GB
16GB 顯卡 → Q3_K_M,檔案 13.82 GB
12GB 以下 → 別硬上 27B,改看 8B 級距的版本
名字裡的數字越小,代表壓縮得越狠,檔案越小,模型也越笨——這是拿聰明程度換空間,沒有例外。
不要把 VRAM 塞到剛好卡滿。知識庫運作時還需要位置放對話脈絡和檢索用的小模型,實際只抓七到八成滿比較保險。剩下的空間是留給系統的,不是留給你多裝一個模型的。
LM Studio 裡有個 GPU Offload 設定,意思是把模型的層數放進顯卡。很多教學叫你直接拉到最高,這是錯的——塞得下才拉滿,塞不下拉滿只會當機或慢到不能用。正確做法是往上調,調到 LM Studio 自己估算的數字剛好貼近你的 VRAM 為止。
Mac 用戶規則不同:Apple Silicon 的記憶體是 CPU 和 GPU 共用的統一記憶體,32GB 以上才跑得動 27B,不能拿 PC 那套對照表去套。
裝好模型只是空殼,RAG 才是它讀懂你資料的方式
顯卡裝好、模型跑起來,那只是一個博學的空殼。它沒看過你的筆記,也不知道你上個月簽的合約長什麼樣。要讓它讀得到,用的技術叫 RAG(Retrieval-Augmented Generation,檢索增強生成):你問問題時,系統先去你的資料夾撈出相關段落,再連同問題一起交給模型,讓它照著那幾段回答。模型本身沒變,變的是它每次回答前看到什麼。
新手直接用 AnythingLLM 最快,指定本機資料夾,它會自動把文件轉成向量索引。但成品好不好用,取決於三件事:
- 格式要乾淨。純文字和可選取文字的 PDF 最好;掃描檔在轉換時只會被讀成一張圖,什麼都撈不到——先跑 OCR。
- 切分大小抓 500 到 1,000 字元。太小,撈到的片段失去上下文;太大,塞進去的無關內容變多,稀釋重點。
- 重疊量設 10% 到 15%。相鄰兩塊留一段重複,避免一句話剛好被切成兩半、兩邊都撈不完整。
還有一個新手最常犯的錯:不要把所有檔案一股腦倒進同一個知識庫。主題差太遠的文件混在一起,檢索時會互相干擾。按專案或主題分開建,效果比堆成大雜燴好得多。
怎麼知道 AI 給的答案是真的,不是編的?
在系統指令裡把邊界劃清楚,明確告訴它「找不到就說找不到」。模型會編造,不是因為它想騙你,是它在你的資料裡找不到答案時,會自動去填通用知識裡「聽起來最像」的東西。實務上有效的系統指令長這樣:
你只能依據提供的參考文件回答。若答案不在文件中,直接回覆「我在提供的資料中找不到答案」。禁止補充文件以外的資訊。
指令不需要短,需要明確。網路上有種說法是「指令越短效能越好」,這個影響小到可以忽略——真正決定成敗的是你有沒有把「不知道要說不知道」講清楚。
接下來這件事很多人搞錯。要求 AI 附上來源文件是有用的,它讓你知道該去翻哪一份。但不能拿「有沒有標來源」當真假的判準——模型連來源都能一起編出來,格式看起來完全正常。真正的驗證只有一種:點開那份文件,確認那段話真的在裡面。
我們做 Content Copilot(我們的內容生產系統)時,把驗證做成流程的一部分,而不是相信模型的自我宣告。影音模組還在開發中,文字模組已經照這個原則在跑。如果模型還是常常離題,先別急著換模型,多半是切分出了問題——把重疊量往上調,或把那份文件單獨拉出來建一個小知識庫,通常就好了。
現在就能做的一件事:三十秒查證,省下一整晚
先確認你的顯卡有幾 GB。Windows 按 Ctrl + Shift + Esc 打開工作管理員,切到「效能」分頁,點左邊的 GPU,看「專用 GPU 記憶體」。Mac 看「關於這台 Mac」的記憶體容量,32GB 以上才跑得動。
有 16GB 以上就去裝 LM Studio,先把模型跑起來聊兩句,確認速度可以接受,再回頭裝 AnythingLLM 接知識庫。順序不要反過來,不然你會分不清是模型的問題還是檢索的問題。
下載之前,去官方頁面確認檔案大小真的塞得進你的顯卡。不採信任何二手整理的教學文,不管它寫得多肯定。這一步花不到三十秒,可以幫你省下一個晚上——我們就是靠它接住了這篇文章的第一版,把 Qwen3.8-Max 換成了 Qwen3.8-27B。
想看我們怎麼把本地模型接進實際產線的,AI 能力展示裡有完整拆解。
關於這篇的數字:Qwen3.8-Max(2.4 兆參數 MoE、約 950 億啟用參數、1M 上下文、2026-08-02 發表)與 Qwen3.8-27B(277.8 億參數、Apache 2.0、262,144 上下文、2026-08-14 開放權重)來自阿里雲官方公告。各壓縮版本的檔案大小是 2026 年 8 月底下載頁的標示,之後可能隨版本更新變動,下載前請以當下頁面為準。
作者:林政賢(導演 · Gen AI 創作者兼工程師 · 瑭宜影像創意工作室創辦人)