---
title: "我差點花 40 萬買一台跑不贏訂閱的機器：本地部署 AI 的完整試算"
url: https://joelin.cc/p/9757
source: https://joelin.cc/p/9757
id: 9757
slug: "local-ai-deployment-cost-reality-check"
pubDate: 2026-09-14
date_modified: 2026-09-14
updatedDate: 2026-09-14
schema_type: BlogPosting
description: "Apple 發表新 Mac Studio 後我認真算了一次：買機器在家跑開源模型到底划不划算。從機型價格階梯、模型分數對標、回本年限到企業為什麼這樣做，每個數字都攤開來看。"
ai_summary: "一人公司規模下自購 Mac Studio 跑本地開源模型的完整成本試算：機型與記憶體價格階梯、開源模型與商業模型的分數對標、回本年限、企業自建的損益平衡點與人力成本，以及判斷任務該用哪一層模型的三問判準。結論為不買，除非有資料不得離機的硬需求。"
key_facts: ["Apple Silicon 的統一記憶體即 GPU 可定址記憶體，本地跑模型不需另購顯卡；此說法僅在 PC 上成立。", "Mac Studio M5 Ultra 96GB 售價 5,499 美金，比 M5 Max 128GB 的 4,799 美金更貴卻少 32GB 記憶體。", "開源模型天花板為 GLM-5.3 的 45 分，需 512GB 機器（估 40 萬台幣以上）；Claude Opus 5 為 51 分，走訂閱即可。分數來源為 Artificial Analysis Intelligence Index v4.3。", "32GB 筆電即可跑 270 億參數模型得 33.9 分，與 Claude Sonnet 5 的 38 分僅差 4 分出頭。", "以最高階 512GB 機型估 40 萬計，對比基本訂閱方案需 26 年回本，且分數永遠停在 45。", "每月低於五千萬 token 用量，雲端 API 幾乎在所有情況下都勝過自建。", "台灣 MLOps 年薪約 150 萬至 250 萬，是二十人份基本訂閱年費 15.4 萬的十倍以上。", "NVIDIA 研究指出微調小模型可處理代理人系統中八到九成的子任務。", "Vercel 2026 年 6 月數據：開源模型佔總支出不到百分之四，卻處理近三分之一工作量。", "雲端 Opus 每秒輸出 53.8 個 token；40 萬的 512GB 機器跑 7,430 億參數開源模型僅每秒 17.7 個。"]
categories: ["商業/科技前沿參考", "新設備與玩具"]
tags: ["本地部署", "開源模型", "Mac Studio", "AI成本", "MLOps"]
authorship:
  origin: written
  ai_role: assist
entity_ids:
  author: https://me.joelin.cc/#joe
  publisher: https://me.joelin.cc/#joelincc
---

# 我差點花 40 萬買一台跑不贏訂閱的機器：本地部署 AI 的完整試算

## 摘要

一人公司規模下自購 Mac Studio 跑本地開源模型的完整成本試算：機型與記憶體價格階梯、開源模型與商業模型的分數對標、回本年限、企業自建的損益平衡點與人力成本，以及判斷任務該用哪一層模型的三問判準。結論為不買，除非有資料不得離機的硬需求。

### 重點

- Apple Silicon 的統一記憶體即 GPU 可定址記憶體，本地跑模型不需另購顯卡；此說法僅在 PC 上成立。
- Mac Studio M5 Ultra 96GB 售價 5,499 美金，比 M5 Max 128GB 的 4,799 美金更貴卻少 32GB 記憶體。
- 開源模型天花板為 GLM-5.3 的 45 分，需 512GB 機器（估 40 萬台幣以上）；Claude Opus 5 為 51 分，走訂閱即可。分數來源為 Artificial Analysis Intelligence Index v4.3。
- 32GB 筆電即可跑 270 億參數模型得 33.9 分，與 Claude Sonnet 5 的 38 分僅差 4 分出頭。
- 以最高階 512GB 機型估 40 萬計，對比基本訂閱方案需 26 年回本，且分數永遠停在 45。
- 每月低於五千萬 token 用量，雲端 API 幾乎在所有情況下都勝過自建。
- 台灣 MLOps 年薪約 150 萬至 250 萬，是二十人份基本訂閱年費 15.4 萬的十倍以上。
- NVIDIA 研究指出微調小模型可處理代理人系統中八到九成的子任務。
- Vercel 2026 年 6 月數據：開源模型佔總支出不到百分之四，卻處理近三分之一工作量。
- 雲端 Opus 每秒輸出 53.8 個 token；40 萬的 512GB 機器跑 7,430 億參數開源模型僅每秒 17.7 個。

結論先講：以我這種一人公司的規模，買一台機器在家裡跑開源模型，帳算不過來。不是機器不夠好，是這條路能到達的天花板，比我現在每個月付的訂閱還低一階。

以下是我從動念到放棄的完整過程，包含每一個數字。文章裡的價格與跑分是 2026 年 9 月的快照，硬體與模型大約每半年換一代，日後回頭看請自行以當期資料校正。

## 我為什麼會動這個念頭

兩件事湊在一起。一是我同時付 ChatGPT 和 Claude 的訂閱，費用是每個月固定在走的；二是 Apple 在八月底發表了新的 Mac mini 與 Mac Studio，記憶體上看 512GB，價格也往上走。

於是很自然的想法出現了：與其每個月付錢，不如一次買一台回來自己跑，長期是不是更划算？

這個念頭我前後問了三次。這次我決定把帳徹底算一遍。

## 先破一個誤解：本地部署一定要另外買顯卡嗎

我聽到的說法是「這些本地模型最後還是要買一張 GPU 顯卡才跑得動」。

這句話在 Windows 或 Linux 的 PC 上是對的。PC 的系統記憶體頻寬大約只有每秒 50 到 100GB，內顯也無法定址大塊記憶體，沒有獨立顯卡確實跑不動。

但在 Apple Silicon 的 Mac 上不成立。M 系列晶片的統一記憶體本身就是 GPU 可以直接定址的記憶體，晶片內建 GPU，不需要另外插卡。我手上那台 32GB 的 MacBook Pro，今天就能跑得動 270 億參數等級的模型。

補充一個時間點：Apple 在 2026 年 4 月才開放 Apple Silicon 的外接 GPU，而且僅限 AI 運算、不含繪圖加速。那是「也可以外掛」，不是「必須外掛」。

真正決定跑不跑得動的是三件事，顯卡只是其中第一件在 PC 上的長相：

- 記憶體容量決定模型多大塞得下，這是 Mac 的強項，統一記憶體可以到 512GB，遠超單張消費級顯卡的 32GB。
- 記憶體頻寬決定吐字多快，M4 是每秒 120GB，RTX 5090 是每秒 1.79TB，Mac 在這格居於劣勢。
- 預填算力決定長輸入的首字延遲，這是 Mac 最容易被忽略的短板。

第三點對我特別致命。實測資料顯示，M1 Max 在 8,500 個 token 的長提示下，帳面生成速度報每秒 51 個 token，但把預填時間算進去，實際有效吞吐只剩每秒 3 個左右。而我的工作型態剛好就是長輸入：整份逐字稿、整批筆記、整個專案的脈絡。

## 查規格：機型與記憶體的價格階梯

把四個機型攤開來看，價格是美金官方定價，台幣為三十二倍概算，台灣實售通常再高一些。

| 機型 | 記憶體 | 美金 | 台幣概算 | 跑得動的天花板 |
|---|---|---|---|---|
| Mac mini M6 | 32GB（上限） | 899 | 2.9 萬 | 270 億參數等級 |
| Mac mini M5 Pro | 64GB（上限） | 1,699 起 | 5.4 萬 | 300 億舒服、700 億勉強 |
| Mac Studio M5 Max | 36GB | 2,499 | 8.0 萬 | 270 億到 300 億等級 |
| Mac Studio M5 Max | 64GB | 3,199 | 10.2 萬 | 同 mini M5 Pro |
| Mac Studio M5 Max | 128GB | 4,799 | 15.4 萬 | 700 億密集模型、1,200 億稀疏模型 |
| Mac Studio M5 Ultra | 96GB | 5,499 | 17.6 萬 | 700 億等級 |
| Mac Studio M5 Ultra | 256GB | 9,499 | 30.4 萬 | 2,000 億到 3,000 億 |
| Mac Studio M5 Ultra | 512GB | 未公布 | 估 40 萬以上 | 4,000 億到 6,000 億 |

這張表有兩個格子會讓人踩到。第一個是 Mac mini M6，它的記憶體天花板是 32GB，而我現在的筆電已經是 32GB，買了等於原地踏步。第二個更隱蔽：Mac Studio M5 Ultra 的 96GB 版本要 5,499 美金，比 M5 Max 的 128GB 版本貴了 700 美金，記憶體卻少了 32GB。看到 Ultra 就以為比較好，很容易買到這一格。

另外要注意，32GB 與 64GB 這兩階，Mac Studio 全面輸給 Mac mini，同樣的記憶體貴了將近一倍。要買小的就買 mini。

## 對標：買到最高階，大概等於什麼等級

這是整件事的轉折點。

網路上流傳一個數字：頂尖的開源模型跟最前沿的商業模型只差九分。這句話本身沒錯，但它會誤導人，因為那個分數是 7,430 億參數以上的模型跑出來的，而那種模型放不進你買得起的機器。

我把同一份指數上的相對位置列出來：

| 分數 | 模型 | 誰跑得動 | 代價 |
|---|---|---|---|
| 51 | Claude Opus 5 | 雲端訂閱 | 月費 |
| 45 | GLM-5.3，開源模型目前最高分 | 512GB 機器 | 估 40 萬以上 |
| 44 | Kimi K3 | 512GB 機器 | 估 40 萬以上 |
| 42 | GLM-5.3-Flash | 256GB 機器 | 30.4 萬 |
| 38 | Claude Sonnet 5 | 雲端訂閱 | 月費 |
| 33.9 | 270 億參數的開源模型 | 我現有的筆電 | 0 元 |

這張表的分數來自 Artificial Analysis Intelligence Index 第 4.3 版，那是一個把十項評測（含 Humanity’s Last Exam、SciCode、Terminal-Bench 等）加總成單一分數的公開指數。前五列我逐一查過該站的模型頁面：[Claude Opus 5](https://artificialanalysis.ai/models/claude-opus-5) 是 51 分、[Claude Sonnet 5](https://artificialanalysis.ai/models/claude-sonnet-5) 是 38 分，開源側的 GLM-5.3、Kimi K3 與 GLM-5.3-Flash 則見[模型總表](https://artificialanalysis.ai/models)。

最後一列的 33.9 分要特別說明：那是經第三方榜單轉載的數字，我沒有在原站找到對應的模型頁面，可信度比前五列低一階，請當成量級參考而不是精確值。同理，這個指數本身也有噪音——我在轉載榜上看過某個知名開源模型只拿到 12.3 分，明顯不合理。所以下面的推論我只用「相對位置」和「差幾個等級」，不逐分比較。

這張表講了三件事：

- 沒有任何一台 Mac 能讓我跑到 Opus 5 那個等級，開源天花板是 45 分，而我每天在用的是 51 分。
- 記憶體從 32GB 加到 512GB，價格從 0 元變成 40 萬以上，分數卻只從 33.9 爬到 45，這條曲線非常平。
- 我現在的筆電零成本就能跑 33.9 分，離 Sonnet 5 的 38 分只差 4 分出頭。

換句話說，花越多錢，買到的是「更接近 Sonnet」，不是「接近 Opus」。

順帶一提，很多人以為開源模型比較小，其實反過來，是大得嚇人。這一級的開源旗艦動輒數千億參數：以能查到完整實測資料的前一版 GLM-5.2 為例，它有 7,430 億參數，四位元量化後仍佔 418GB，這就是為什麼它需要那台 40 萬的機器。小的是能塞進筆電的那顆。

## 算帳：以及「幾年回本」為什麼是錯的問題

先算表面的帳。

| 買什麼 | 得到幾分 | 對比兩邊都訂基本方案 | 對比最高階訂閱 |
|---|---|---|---|
| M5 Max 128GB（15.4 萬） | 34 到 38 | 10 年回本 | 2 年 |
| M5 Ultra 512GB（估 40 萬） | 45 | 26 年回本 | 5.2 年 |

參考基準是 Claude Pro 與 ChatGPT Plus 都是每月 20 美金，最高階的 Max 20x 與 ChatGPT Pro 都是每月 200 美金。另外還有電費：Mac Studio 推論時的功耗大約 160 到 270 瓦，每天跑四小時加上其餘待機，一年大約一千度電。

但算到這裡我發現，「幾年回本」這個問題本身就是錯的，因為兩邊買到的不是同一個東西。

花 40 萬買到 45 分，然後永遠停在 45 分。要更高只能再買一台，而本地模型大約每半年換一代，硬體卻綁死在採購當下的模型尺寸。

付月費買到 51 分，而且持續自動升級。同一筆訂閱費，過去兩年從 Sonnet 3.5 一路吃到 Opus 5，我什麼都不用做。

所以不是「幾年回本」，是「永遠不會回本，因為買到的是一個會持續貶值的低配版」。

唯一能翻轉這個結論的變數只有一個：資料絕對不能離開這台機器。如果沒有這種硬需求，訂閱在任何年限下都贏。

## 那為什麼還是有很多公司在做本地部署

這是我查下去之後最有收穫的一段，因為答案跟我原本想的不一樣。

先看門檻。多份 2026 年的產業成本分析給出的區間略有出入，我取的是彼此重疊的那一段：

| 每月 token 用量 | 結論 |
|---|---|
| 低於 5,000 萬 | 雲端 API 幾乎在所有情況下都贏，不必考慮自建 |
| 5,000 萬到 5 億 | 真正的決策點，但前提是公司已經有專職維運人力 |
| 每天 5 億以上 | 自建最多可以省到五倍 |

實際能省多少，也跟用量成正比：

| 用量規模 | 省下的比例 |
|---|---|
| 整體平均（Deloitte 的調查） | 約 40% |
| 每天 800 萬到 3,000 萬 token | 40% 到 60% |
| 每天 1 億 token 以上 | 60% 到 70% |

兩張表要合起來看才有意義。第一張講的是「什麼時候該開始考慮」，第二張講的是「真的做了能省多少」。而兩張表的共同前提是同一件事：你得先有量。量不夠的時候，省下的比例再高，分母也小到不值得為它養一套基礎設施。這兩組數字來自不同的產業分析與顧問報告，取值區間彼此不完全一致，所以請當作量級判斷用，不要當成精算基準。

MLOps 這個詞需要解釋一下。它是 Machine Learning Operations 的縮寫，白話講就是專門養模型的維運工程師。模型不是裝好就會自己跑：要挑版本、量化壓縮、調推論參數、監控吞吐與記憶體、模型更新時重新測試、半夜掛掉要有人爬起來修。這個人要同時懂 AI 和伺服器維運，市場上很搶手也很貴，台灣的年薪大約在 150 萬到 250 萬之間。

一個類比：你不會為了省 Gmail 的錢自己架一台郵件伺服器。不是架不起來，是架完之後每天都要有人顧。MLOps 就是那個顧的人。

有兩筆成本是外行最容易漏算的：

- GPU 的採購金額只佔真實基礎設施投資的三到四成，要抓兩倍半到三倍的乘數。
- 工程人力的支出通常超過硬體本身，所謂「免費」的開源模型，一年可能吃掉五十萬美金以上的工程時間。

### 二十人的公司划得來嗎

這是我覺得最值得攤開來算的一格，因為二十人剛好是「用量第一次碰到決策點」的規模。二十個知識工作者，每人每天約一百次互動，全公司大約每月三億個 token，確實落在前面那張表的決策區間裡。

但把兩邊的帳並排放，答案就很清楚了：

| 走自建 | 走訂閱 |
|---|---|
| 硬體：少則 15 萬，多則 40 萬以上 | 二十人份基本方案訂閱，一年約 15.4 萬 |
| 專職維運人力：年薪 150 萬到 250 萬 | 不需要 |
| 硬體每半年面臨一次世代更替 | 模型自動升級，不必做任何事 |
| 出事要有人處理 | 出事不是你的問題 |

光是那一個工程師的薪水，就是二十人訂閱費的十倍以上。硬體都還沒開始算就輸了。

而且錢只是其中一半。另一半是心力：買了機器之後，那台機器就是你的了——它要有人顧、有人修、有人跟上模型換代。訂閱則是把這些全部外包出去，你付的那筆錢裡本來就含了「不必操心」這一項。在二十人這個規模，省心的價值往往比省錢更實際。

## 分水嶺不是人數，是工作的性質

所以「幾個人才划算」這個問題也問錯了。真正的分水嶺是兩個維度交叉出來的：

|  | 低智力密度的工作 | 高智力密度的工作 |
|---|---|---|
| 高用量 | 本地划算，例如客服、分類、摘要 | 雲端划算 |
| 低用量 | 雲端划算 | 雲端划算 |

這張表把我的處境放進去就很清楚了。我有好幾個 AI 代理人同時在跑，屬於高用量；但它們做的全是判斷型的工作，屬於高智力密度；我沒有 MLOps 人力，也沒有合規上的硬需求。四個變數沒有一個站在自建那邊。

而更有意思的是，企業真正在做的事，跟「用本地取代雲端」根本不是同一件事。

Vercel 在 2026 年 6 月公布的流量數據顯示，開源模型佔他們總支出不到百分之四，卻處理了將近三分之一的工作量。OpenRouter 截至 2026 年 9 月的排行也是同一個形狀：token 用量前兩名都是開源的次旗艦版本，而不是各家旗艦；中國來源的模型已佔總 token 量超過四成五，一年前還不到百分之二。

兩個獨立的數據指向同一件事：便宜的模型吃掉了 token 用量，昂貴的模型吃掉了金額。企業不是用本地取代雲端，是用本地接掉低階那一段，高階照樣走雲端。而有人用路由的方式把兩邊接起來，可以砍掉四成到八成五的成本而品質幾乎不變，AT&T 就靠這招把寫程式的 AI 成本砍了五成六。

這件事不必等到你變成企業才能做。

## 什麼樣的事情用便宜模型就夠

這是我認為讀者最能直接帶走的一段。

NVIDIA 有一篇研究指出，在已經部署的代理人系統裡，大多數的子任務是重複的、範圍很窄的、非對話式的，而經過微調的小模型可以處理其中八成到九成。換句話說，那些「雜事」不是邊角料，而是實際工作量的絕大多數。

具體來說，這些任務用小模型或中階模型就夠：

- 分類，例如意圖辨識、情緒判斷、文件分流。
- 抽取，例如從文件裡把欄位挖出來、整理成結構化資料。
- 受限摘要，也就是給定格式與長度的摘要。
- 路由，把請求判斷完丟給下一關。
- 標註，例如打標籤、把資料統一成同一個格式。
- 可預測的轉換，例如固定規則的格式改寫。

能力基準線也在往下移：30 億到 140 億參數的模型，現在大約等於一年前的 700 億。

而怎麼判斷一件事該用哪一層，我把它收斂成三個問題：

1. 這件事的輸入是結構化的嗎？如果是，寫程式就好，不要叫 LLM 做。
2. 輸出可以列舉嗎？如果答案落在有限的類別或固定的格式裡，小模型或中階模型就夠。
3. 需要跨脈絡權衡、產生事先無法列舉的判斷嗎？只有這一格才輪到最前沿的模型。

一句話總結：LLM 只該出現在「規則寫不出來」的那一格，而最前沿的模型只該出現在「答案無法列舉」的那一格。

這也解釋了業界的共識為什麼是分層而不是二選一。確定性的程式碼是便宜的地板，它可以免費攔掉三到六成的失敗；而把 LLM 放在同步的熱路徑上之前，前面的級聯應該已經先濾掉九成的流量。

### 怎麼把一件事從貴的那層搬到便宜那層

判斷完屬於哪一層之後，真正的操作是把任務往下搬。我自己在用的作法是這樣：

1. 難的規劃和難的執行，交給最前沿的模型。
2. 一旦某個流程重複到開始固化，就請那個厲害的模型把流程本身梳理出來，順便讓它設定檢核點——哪幾步要驗、驗什麼、什麼情況要中止並回報。
3. 流程和檢核點都定下來之後，這件事就交給便宜甚至低階的模型一直跑。

這一層等於是 AI 代理人系統裡最基礎的執行端。它不只是照著做，還可以承擔初階的檢核、發現基礎的問題，真正拿不準的才往上呈報。

關鍵在於第二步。多數人卡住的地方不是「不知道該用便宜模型」，而是流程還沒被梳理成一份明確的步驟與檢核點，所以只好每次都叫最貴的模型從頭想一遍。梳理這件事本身值得用貴的模型做一次，因為它是一次性成本，而省下來的是往後每一次的執行成本。

順帶一提，我先前寫過怎麼用 AI 處理家庭帳務的雜事，那篇裡面做的事，正好全部落在上面第一、二格。

## 最後一道驗證：真的去跑的人，後來怎麼了

前面全部是紙上的帳。但我聽到的社群反饋補上了另一半：有人真的在自己的機器上跑開源模型，跑到會生氣，最後還是回到線上重跑一次。抱怨最集中的一點是速度太慢。

這件事有機制可以解釋，而且解釋完會發現，加錢並不能解決。

| 在哪裡跑 | 實際吐字速度 |
|---|---|
| Claude Sonnet 5（雲端） | 每秒 75.7 個 token |
| Claude Opus 4.8 或 5（雲端） | 每秒 53.8 個 |
| 256GB 以上的機器跑 2,350 億參數的稀疏模型 | 每秒 16 到 24 個，樂觀的實測可到 26 至 35 |
| 花 40 萬買 512GB 跑 7,430 億參數的大型開源模型 | 每秒 17.7 個 |
| 我的 32GB 筆電跑 270 億參數模型 | 每秒 5 到 6 個 |
| 長提示（8,500 token）含預填的實際有效速度 | 每秒約 3 個 |

這張表有兩件事值得看。

第一，花 40 萬把速度從每秒 5 個推到 17.7 個，聽起來進步很多，但雲端那一側是每秒 53.8 到 75.7 個，所以買到頂還是慢三到四倍，而分數上限也還差六分。

第二，如果你打算在本地跑一個「大約是 Sonnet 那個水準」的開源模型，也就是 2,000 億參數上下這一級，實測落在每秒 16 到 24 個之間，樂觀一點的框架可以到 35。而雲端的 Sonnet 5 是每秒 75.7 個。也就是說，就算你只想要中階的智力水準，本地跑仍然慢上兩到五倍。順帶一提，Sonnet 5 的輸出速度其實比 Opus 還快，所以拿中階來比，差距反而比拿最前沿來比更難看。速度那一列的實測數字來自第三方對 512GB 機型的實測報告，量到的是前一版的 7,430 億參數模型；新一代機器要到 2026 年 9 月下旬才出貨，屆時數字應該會往上修，但差距的方向不會反轉。

所以「慢」不是配備不夠，是這條路的結構性結果。那些跑到生氣的人，感受是準確的，而他們回到線上的選擇，跟我在試算表上算出來的結論完全一致——只是他們用時間換到了答案，我用了一個下午。

## 所以我的結論

我不買。不是因為 Mac 不好，也不是因為本地部署沒有價值，而是以我的用途來說，這條路能到的地方比我現在站的位置還低。

如果你正在考慮同一件事，我建議你不要直接看「幾年回本」，先問三個問題：你要它做的事，落在智力密度的哪一格？你有沒有人可以顧那台機器？你有沒有「資料絕對不能出門」的硬需求？

三個問題答完，這筆錢要不要花，答案通常就出來了。

本文關鍵字：本地部署、開源模型、Mac Studio、Mac mini、AI 訂閱成本、MLOps、統一記憶體、模型對標

## 常見問題

### 在 Mac 上跑本地 AI 模型需要另外買顯卡嗎？

不需要。Apple Silicon 的統一記憶體本身就是 GPU 可以直接定址的記憶體，晶片也內建 GPU。一台 32GB 的 MacBook Pro 現在就能跑 270 億參數等級的模型。「一定要買顯卡」這個說法只在 Windows 或 Linux 的 PC 上成立，因為 PC 的系統記憶體頻寬不足且內顯無法定址大塊記憶體。

### 買最高階的 Mac Studio 可以跑到跟 ChatGPT 或 Claude 一樣的等級嗎？

不行。512GB 的機型可以跑到開源模型目前的天花板 45 分，而 Claude Opus 5 是 51 分。花越多錢買到的是更接近中階模型的水準，不是接近最前沿。記憶體從 32GB 加到 512GB，分數只從 33.9 爬到 45，但價格從零變成 40 萬以上。分數依據為 Artificial Analysis Intelligence Index 第 4.3 版。

### 幾個人的公司做本地部署才划算？

人數不是關鍵變數，工作性質才是。二十人公司的用量雖然落在決策區間內，但該區間的前提是已經有專職維運人力；新聘一位 MLOps 年薪 150 萬起，是二十人份訂閱年費的十倍以上。真正划算的條件是高用量加上低智力密度的重複性工作，例如客服、分類與摘要。

### 哪些工作用便宜的模型就夠？

分類、抽取、受限摘要、路由、標註與可預測的格式轉換這幾類，用小模型或中階模型就足夠。判斷方式是三個問題：輸入若是結構化的就直接寫程式；輸出若能列舉成有限類別或固定格式，小模型就夠；只有需要跨脈絡權衡、產生事先無法列舉的判斷時，才輪到最前沿的模型。
