我差點花 40 萬買一台跑不贏訂閱的機器:本地部署 AI 的完整試算

主筆 | 2026-09-14 | 商業/科技前沿參考 新設備與玩具 | 4 minutes of reading

本篇摘要

一人公司規模下自購 Mac Studio 跑本地開源模型的完整成本試算:機型與記憶體價格階梯、開源模型與商業模型的分數對標、回本年限、企業自建的損益平衡點與人力成本,以及判斷任務該用哪一層模型的三問判準。結論為不買,除非有資料不得離機的硬需求。

  • Apple Silicon 的統一記憶體即 GPU 可定址記憶體,本地跑模型不需另購顯卡;此說法僅在 PC 上成立。
  • Mac Studio M5 Ultra 96GB 售價 5,499 美金,比 M5 Max 128GB 的 4,799 美金更貴卻少 32GB 記憶體。
  • 開源模型天花板為 GLM-5.3 的 45 分,需 512GB 機器(估 40 萬台幣以上);Claude Opus 5 為 51 分,走訂閱即可。分數來源為 Artificial Analysis Intelligence Index v4.3。
  • 32GB 筆電即可跑 270 億參數模型得 33.9 分,與 Claude Sonnet 5 的 38 分僅差 4 分出頭。
  • 以最高階 512GB 機型估 40 萬計,對比基本訂閱方案需 26 年回本,且分數永遠停在 45。
  • 每月低於五千萬 token 用量,雲端 API 幾乎在所有情況下都勝過自建。
  • 台灣 MLOps 年薪約 150 萬至 250 萬,是二十人份基本訂閱年費 15.4 萬的十倍以上。
  • NVIDIA 研究指出微調小模型可處理代理人系統中八到九成的子任務。
  • Vercel 2026 年 6 月數據:開源模型佔總支出不到百分之四,卻處理近三分之一工作量。
  • 雲端 Opus 每秒輸出 53.8 個 token;40 萬的 512GB 機器跑 7,430 億參數開源模型僅每秒 17.7 個。
本篇目錄(15 節)
  1. 我為什麼會動這個念頭
  2. 先破一個誤解:本地部署一定要另外買顯卡嗎
  3. 查規格:機型與記憶體的價格階梯
  4. 對標:買到最高階,大概等於什麼等級
  5. 算帳:以及「幾年回本」為什麼是錯的問題
  6. 那為什麼還是有很多公司在做本地部署
  7. 二十人的公司划得來嗎
  8. 分水嶺不是人數,是工作的性質
  9. 什麼樣的事情用便宜模型就夠
  10. 怎麼把一件事從貴的那層搬到便宜那層
  11. 最後一道驗證:真的去跑的人,後來怎麼了
  12. 所以我的結論
  13. 訂閱更多關於 老喬報 joelin.cc 的消息
  14. 備註與警語
  15. 文章更新日誌

結論先講:以我這種一人公司的規模,買一台機器在家裡跑開源模型,帳算不過來。不是機器不夠好,是這條路能到達的天花板,比我現在每個月付的訂閱還低一階。

以下是我從動念到放棄的完整過程,包含每一個數字。文章裡的價格與跑分是 2026 年 9 月的快照,硬體與模型大約每半年換一代,日後回頭看請自行以當期資料校正。

我為什麼會動這個念頭

兩件事湊在一起。一是我同時付 ChatGPT 和 Claude 的訂閱,費用是每個月固定在走的;二是 Apple 在八月底發表了新的 Mac mini 與 Mac Studio,記憶體上看 512GB,價格也往上走。

於是很自然的想法出現了:與其每個月付錢,不如一次買一台回來自己跑,長期是不是更划算?

這個念頭我前後問了三次。這次我決定把帳徹底算一遍。

先破一個誤解:本地部署一定要另外買顯卡嗎

我聽到的說法是「這些本地模型最後還是要買一張 GPU 顯卡才跑得動」。

這句話在 Windows 或 Linux 的 PC 上是對的。PC 的系統記憶體頻寬大約只有每秒 50 到 100GB,內顯也無法定址大塊記憶體,沒有獨立顯卡確實跑不動。

但在 Apple Silicon 的 Mac 上不成立。M 系列晶片的統一記憶體本身就是 GPU 可以直接定址的記憶體,晶片內建 GPU,不需要另外插卡。我手上那台 32GB 的 MacBook Pro,今天就能跑得動 270 億參數等級的模型。

補充一個時間點:Apple 在 2026 年 4 月才開放 Apple Silicon 的外接 GPU,而且僅限 AI 運算、不含繪圖加速。那是「也可以外掛」,不是「必須外掛」。

真正決定跑不跑得動的是三件事,顯卡只是其中第一件在 PC 上的長相:

  • 記憶體容量決定模型多大塞得下,這是 Mac 的強項,統一記憶體可以到 512GB,遠超單張消費級顯卡的 32GB。
  • 記憶體頻寬決定吐字多快,M4 是每秒 120GB,RTX 5090 是每秒 1.79TB,Mac 在這格居於劣勢。
  • 預填算力決定長輸入的首字延遲,這是 Mac 最容易被忽略的短板。

第三點對我特別致命。實測資料顯示,M1 Max 在 8,500 個 token 的長提示下,帳面生成速度報每秒 51 個 token,但把預填時間算進去,實際有效吞吐只剩每秒 3 個左右。而我的工作型態剛好就是長輸入:整份逐字稿、整批筆記、整個專案的脈絡。

查規格:機型與記憶體的價格階梯

把四個機型攤開來看,價格是美金官方定價,台幣為三十二倍概算,台灣實售通常再高一些。

機型 記憶體 美金 台幣概算 跑得動的天花板
Mac mini M6 32GB(上限) 899 2.9 萬 270 億參數等級
Mac mini M5 Pro 64GB(上限) 1,699 起 5.4 萬 300 億舒服、700 億勉強
Mac Studio M5 Max 36GB 2,499 8.0 萬 270 億到 300 億等級
Mac Studio M5 Max 64GB 3,199 10.2 萬 同 mini M5 Pro
Mac Studio M5 Max 128GB 4,799 15.4 萬 700 億密集模型、1,200 億稀疏模型
Mac Studio M5 Ultra 96GB 5,499 17.6 萬 700 億等級
Mac Studio M5 Ultra 256GB 9,499 30.4 萬 2,000 億到 3,000 億
Mac Studio M5 Ultra 512GB 未公布 估 40 萬以上 4,000 億到 6,000 億

這張表有兩個格子會讓人踩到。第一個是 Mac mini M6,它的記憶體天花板是 32GB,而我現在的筆電已經是 32GB,買了等於原地踏步。第二個更隱蔽:Mac Studio M5 Ultra 的 96GB 版本要 5,499 美金,比 M5 Max 的 128GB 版本貴了 700 美金,記憶體卻少了 32GB。看到 Ultra 就以為比較好,很容易買到這一格。

另外要注意,32GB 與 64GB 這兩階,Mac Studio 全面輸給 Mac mini,同樣的記憶體貴了將近一倍。要買小的就買 mini。

對標:買到最高階,大概等於什麼等級

這是整件事的轉折點。

網路上流傳一個數字:頂尖的開源模型跟最前沿的商業模型只差九分。這句話本身沒錯,但它會誤導人,因為那個分數是 7,430 億參數以上的模型跑出來的,而那種模型放不進你買得起的機器。

我把同一份指數上的相對位置列出來:

分數 模型 誰跑得動 代價
51 Claude Opus 5 雲端訂閱 月費
45 GLM-5.3,開源模型目前最高分 512GB 機器 估 40 萬以上
44 Kimi K3 512GB 機器 估 40 萬以上
42 GLM-5.3-Flash 256GB 機器 30.4 萬
38 Claude Sonnet 5 雲端訂閱 月費
33.9 270 億參數的開源模型 我現有的筆電 0 元

這張表的分數來自 Artificial Analysis Intelligence Index 第 4.3 版,那是一個把十項評測(含 Humanity’s Last Exam、SciCode、Terminal-Bench 等)加總成單一分數的公開指數。前五列我逐一查過該站的模型頁面:Claude Opus 5 是 51 分、Claude Sonnet 5 是 38 分,開源側的 GLM-5.3、Kimi K3 與 GLM-5.3-Flash 則見模型總表

最後一列的 33.9 分要特別說明:那是經第三方榜單轉載的數字,我沒有在原站找到對應的模型頁面,可信度比前五列低一階,請當成量級參考而不是精確值。同理,這個指數本身也有噪音——我在轉載榜上看過某個知名開源模型只拿到 12.3 分,明顯不合理。所以下面的推論我只用「相對位置」和「差幾個等級」,不逐分比較。

這張表講了三件事:

  • 沒有任何一台 Mac 能讓我跑到 Opus 5 那個等級,開源天花板是 45 分,而我每天在用的是 51 分。
  • 記憶體從 32GB 加到 512GB,價格從 0 元變成 40 萬以上,分數卻只從 33.9 爬到 45,這條曲線非常平。
  • 我現在的筆電零成本就能跑 33.9 分,離 Sonnet 5 的 38 分只差 4 分出頭。

換句話說,花越多錢,買到的是「更接近 Sonnet」,不是「接近 Opus」。

順帶一提,很多人以為開源模型比較小,其實反過來,是大得嚇人。這一級的開源旗艦動輒數千億參數:以能查到完整實測資料的前一版 GLM-5.2 為例,它有 7,430 億參數,四位元量化後仍佔 418GB,這就是為什麼它需要那台 40 萬的機器。小的是能塞進筆電的那顆。

算帳:以及「幾年回本」為什麼是錯的問題

先算表面的帳。

買什麼 得到幾分 對比兩邊都訂基本方案 對比最高階訂閱
M5 Max 128GB(15.4 萬) 34 到 38 10 年回本 2 年
M5 Ultra 512GB(估 40 萬) 45 26 年回本 5.2 年

參考基準是 Claude Pro 與 ChatGPT Plus 都是每月 20 美金,最高階的 Max 20x 與 ChatGPT Pro 都是每月 200 美金。另外還有電費:Mac Studio 推論時的功耗大約 160 到 270 瓦,每天跑四小時加上其餘待機,一年大約一千度電。

但算到這裡我發現,「幾年回本」這個問題本身就是錯的,因為兩邊買到的不是同一個東西。

花 40 萬買到 45 分,然後永遠停在 45 分。要更高只能再買一台,而本地模型大約每半年換一代,硬體卻綁死在採購當下的模型尺寸。

付月費買到 51 分,而且持續自動升級。同一筆訂閱費,過去兩年從 Sonnet 3.5 一路吃到 Opus 5,我什麼都不用做。

所以不是「幾年回本」,是「永遠不會回本,因為買到的是一個會持續貶值的低配版」。

唯一能翻轉這個結論的變數只有一個:資料絕對不能離開這台機器。如果沒有這種硬需求,訂閱在任何年限下都贏。

那為什麼還是有很多公司在做本地部署

這是我查下去之後最有收穫的一段,因為答案跟我原本想的不一樣。

先看門檻。多份 2026 年的產業成本分析給出的區間略有出入,我取的是彼此重疊的那一段:

每月 token 用量 結論
低於 5,000 萬 雲端 API 幾乎在所有情況下都贏,不必考慮自建
5,000 萬到 5 億 真正的決策點,但前提是公司已經有專職維運人力
每天 5 億以上 自建最多可以省到五倍

實際能省多少,也跟用量成正比:

用量規模 省下的比例
整體平均(Deloitte 的調查) 約 40%
每天 800 萬到 3,000 萬 token 40% 到 60%
每天 1 億 token 以上 60% 到 70%

兩張表要合起來看才有意義。第一張講的是「什麼時候該開始考慮」,第二張講的是「真的做了能省多少」。而兩張表的共同前提是同一件事:你得先有量。量不夠的時候,省下的比例再高,分母也小到不值得為它養一套基礎設施。這兩組數字來自不同的產業分析與顧問報告,取值區間彼此不完全一致,所以請當作量級判斷用,不要當成精算基準。

MLOps 這個詞需要解釋一下。它是 Machine Learning Operations 的縮寫,白話講就是專門養模型的維運工程師。模型不是裝好就會自己跑:要挑版本、量化壓縮、調推論參數、監控吞吐與記憶體、模型更新時重新測試、半夜掛掉要有人爬起來修。這個人要同時懂 AI 和伺服器維運,市場上很搶手也很貴,台灣的年薪大約在 150 萬到 250 萬之間。

一個類比:你不會為了省 Gmail 的錢自己架一台郵件伺服器。不是架不起來,是架完之後每天都要有人顧。MLOps 就是那個顧的人。

有兩筆成本是外行最容易漏算的:

  • GPU 的採購金額只佔真實基礎設施投資的三到四成,要抓兩倍半到三倍的乘數。
  • 工程人力的支出通常超過硬體本身,所謂「免費」的開源模型,一年可能吃掉五十萬美金以上的工程時間。

二十人的公司划得來嗎

這是我覺得最值得攤開來算的一格,因為二十人剛好是「用量第一次碰到決策點」的規模。二十個知識工作者,每人每天約一百次互動,全公司大約每月三億個 token,確實落在前面那張表的決策區間裡。

但把兩邊的帳並排放,答案就很清楚了:

走自建 走訂閱
硬體:少則 15 萬,多則 40 萬以上 二十人份基本方案訂閱,一年約 15.4 萬
專職維運人力:年薪 150 萬到 250 萬 不需要
硬體每半年面臨一次世代更替 模型自動升級,不必做任何事
出事要有人處理 出事不是你的問題

光是那一個工程師的薪水,就是二十人訂閱費的十倍以上。硬體都還沒開始算就輸了。

而且錢只是其中一半。另一半是心力:買了機器之後,那台機器就是你的了——它要有人顧、有人修、有人跟上模型換代。訂閱則是把這些全部外包出去,你付的那筆錢裡本來就含了「不必操心」這一項。在二十人這個規模,省心的價值往往比省錢更實際。

分水嶺不是人數,是工作的性質

所以「幾個人才划算」這個問題也問錯了。真正的分水嶺是兩個維度交叉出來的:

低智力密度的工作 高智力密度的工作
高用量 本地划算,例如客服、分類、摘要 雲端划算
低用量 雲端划算 雲端划算

這張表把我的處境放進去就很清楚了。我有好幾個 AI 代理人同時在跑,屬於高用量;但它們做的全是判斷型的工作,屬於高智力密度;我沒有 MLOps 人力,也沒有合規上的硬需求。四個變數沒有一個站在自建那邊。

而更有意思的是,企業真正在做的事,跟「用本地取代雲端」根本不是同一件事。

Vercel 在 2026 年 6 月公布的流量數據顯示,開源模型佔他們總支出不到百分之四,卻處理了將近三分之一的工作量。OpenRouter 截至 2026 年 9 月的排行也是同一個形狀:token 用量前兩名都是開源的次旗艦版本,而不是各家旗艦;中國來源的模型已佔總 token 量超過四成五,一年前還不到百分之二。

兩個獨立的數據指向同一件事:便宜的模型吃掉了 token 用量,昂貴的模型吃掉了金額。企業不是用本地取代雲端,是用本地接掉低階那一段,高階照樣走雲端。而有人用路由的方式把兩邊接起來,可以砍掉四成到八成五的成本而品質幾乎不變,AT&T 就靠這招把寫程式的 AI 成本砍了五成六。

這件事不必等到你變成企業才能做。

什麼樣的事情用便宜模型就夠

這是我認為讀者最能直接帶走的一段。

NVIDIA 有一篇研究指出,在已經部署的代理人系統裡,大多數的子任務是重複的、範圍很窄的、非對話式的,而經過微調的小模型可以處理其中八成到九成。換句話說,那些「雜事」不是邊角料,而是實際工作量的絕大多數。

具體來說,這些任務用小模型或中階模型就夠:

  • 分類,例如意圖辨識、情緒判斷、文件分流。
  • 抽取,例如從文件裡把欄位挖出來、整理成結構化資料。
  • 受限摘要,也就是給定格式與長度的摘要。
  • 路由,把請求判斷完丟給下一關。
  • 標註,例如打標籤、把資料統一成同一個格式。
  • 可預測的轉換,例如固定規則的格式改寫。

能力基準線也在往下移:30 億到 140 億參數的模型,現在大約等於一年前的 700 億。

而怎麼判斷一件事該用哪一層,我把它收斂成三個問題:

  1. 這件事的輸入是結構化的嗎?如果是,寫程式就好,不要叫 LLM 做。
  2. 輸出可以列舉嗎?如果答案落在有限的類別或固定的格式裡,小模型或中階模型就夠。
  3. 需要跨脈絡權衡、產生事先無法列舉的判斷嗎?只有這一格才輪到最前沿的模型。

一句話總結:LLM 只該出現在「規則寫不出來」的那一格,而最前沿的模型只該出現在「答案無法列舉」的那一格。

這也解釋了業界的共識為什麼是分層而不是二選一。確定性的程式碼是便宜的地板,它可以免費攔掉三到六成的失敗;而把 LLM 放在同步的熱路徑上之前,前面的級聯應該已經先濾掉九成的流量。

怎麼把一件事從貴的那層搬到便宜那層

判斷完屬於哪一層之後,真正的操作是把任務往下搬。我自己在用的作法是這樣:

  1. 難的規劃和難的執行,交給最前沿的模型。
  2. 一旦某個流程重複到開始固化,就請那個厲害的模型把流程本身梳理出來,順便讓它設定檢核點——哪幾步要驗、驗什麼、什麼情況要中止並回報。
  3. 流程和檢核點都定下來之後,這件事就交給便宜甚至低階的模型一直跑。

這一層等於是 AI 代理人系統裡最基礎的執行端。它不只是照著做,還可以承擔初階的檢核、發現基礎的問題,真正拿不準的才往上呈報。

關鍵在於第二步。多數人卡住的地方不是「不知道該用便宜模型」,而是流程還沒被梳理成一份明確的步驟與檢核點,所以只好每次都叫最貴的模型從頭想一遍。梳理這件事本身值得用貴的模型做一次,因為它是一次性成本,而省下來的是往後每一次的執行成本。

順帶一提,我先前寫過怎麼用 AI 處理家庭帳務的雜事,那篇裡面做的事,正好全部落在上面第一、二格。

最後一道驗證:真的去跑的人,後來怎麼了

前面全部是紙上的帳。但我聽到的社群反饋補上了另一半:有人真的在自己的機器上跑開源模型,跑到會生氣,最後還是回到線上重跑一次。抱怨最集中的一點是速度太慢。

這件事有機制可以解釋,而且解釋完會發現,加錢並不能解決。

在哪裡跑 實際吐字速度
Claude Sonnet 5(雲端) 每秒 75.7 個 token
Claude Opus 4.8 或 5(雲端) 每秒 53.8 個
256GB 以上的機器跑 2,350 億參數的稀疏模型 每秒 16 到 24 個,樂觀的實測可到 26 至 35
花 40 萬買 512GB 跑 7,430 億參數的大型開源模型 每秒 17.7 個
我的 32GB 筆電跑 270 億參數模型 每秒 5 到 6 個
長提示(8,500 token)含預填的實際有效速度 每秒約 3 個

這張表有兩件事值得看。

第一,花 40 萬把速度從每秒 5 個推到 17.7 個,聽起來進步很多,但雲端那一側是每秒 53.8 到 75.7 個,所以買到頂還是慢三到四倍,而分數上限也還差六分。

第二,如果你打算在本地跑一個「大約是 Sonnet 那個水準」的開源模型,也就是 2,000 億參數上下這一級,實測落在每秒 16 到 24 個之間,樂觀一點的框架可以到 35。而雲端的 Sonnet 5 是每秒 75.7 個。也就是說,就算你只想要中階的智力水準,本地跑仍然慢上兩到五倍。順帶一提,Sonnet 5 的輸出速度其實比 Opus 還快,所以拿中階來比,差距反而比拿最前沿來比更難看。速度那一列的實測數字來自第三方對 512GB 機型的實測報告,量到的是前一版的 7,430 億參數模型;新一代機器要到 2026 年 9 月下旬才出貨,屆時數字應該會往上修,但差距的方向不會反轉。

所以「慢」不是配備不夠,是這條路的結構性結果。那些跑到生氣的人,感受是準確的,而他們回到線上的選擇,跟我在試算表上算出來的結論完全一致——只是他們用時間換到了答案,我用了一個下午。

所以我的結論

我不買。不是因為 Mac 不好,也不是因為本地部署沒有價值,而是以我的用途來說,這條路能到的地方比我現在站的位置還低。

如果你正在考慮同一件事,我建議你不要直接看「幾年回本」,先問三個問題:你要它做的事,落在智力密度的哪一格?你有沒有人可以顧那台機器?你有沒有「資料絕對不能出門」的硬需求?

三個問題答完,這筆錢要不要花,答案通常就出來了。

本文關鍵字:本地部署、開源模型、Mac Studio、Mac mini、AI 訂閱成本、MLOps、統一記憶體、模型對標