---
title: "小模型能不能判讀網站關鍵字？選擇題可以，「站上有沒有答案」還是要大模型｜Jev、Clef、GLM 實測"
url: https://joelin.cc/p/9897
source: https://joelin.cc/p/9897
id: 9897
lang: zh-TW
slug: "ai-model-exam-before-switching"
pubDate: 2026-10-11
date_modified: 2026-10-11
updatedDate: 2026-10-11
schema_type: BlogPosting
description: "原本想測 Jev 這類小模型能不能判讀網站關鍵字，結果發現要分兩種工作：選擇題型的判斷，Jev、Clef 又快又便宜就夠用；判斷站上有沒有一頁回答搜尋字，還是要大模型，最後從 gpt-4.1-mini 換成 GLM-5.3-flash。"
ai_summary: "老喬為了網站關鍵字分析，測試小模型 Jev 能否判讀搜尋字。結論是判讀分兩種難度：文章分類、名字比對這類選擇題，閱卷機型的小模型 Jev、Clef 已有八到九成以上準確度，且自報把握可信；判斷「站上有沒有一頁回答這個搜尋字」則需要讀懂並抄出原文，小模型不夠，最後由 GLM-5.3-flash 取代原本的 gpt-4.1-mini，在 233 題考卷的 46 個內容缺口中抓到 39 個（gpt 17 個）。這些模型在 Cloudflare Workers AI 上已串好，價格更低，代價是大模型每題要等 20 到 30 秒。文末整理可複用的考法。"
key_facts: ["網站關鍵字分析每週撈出「有人搜、站上可能沒好好回答」的搜尋字，再由 AI 判讀站上有沒有答案；原本使用 gpt-4.1-mini。", "Jev 與 Clef 是只會從選項挑答案、附把握度的閱卷機型小模型，在 Cloudflare Workers AI 上可直接呼叫。", "文章六選一分類練習卷：GLM-5.3-flash 97.2%／98.1%、Clef 93.5%、Jev 87.0%、gpt-4.1-mini 77.8%／75.9%，全猜為 16.7%。", "同名不同物 13 題：GLM-5.3-flash 全對、Jev 12 題、Clef 11 題、gpt-4.1-mini 4 題。", "Jev 自報八成以上把握的題目 96% 答對；判讀「站上有沒有答案」時，Jev 單獨測試分數僅 75% 到 79.5%。", "第一份 110 題考卷的測試卷中，44 題有 34 題正解為「有回答」，全猜即得 77.3%，無法分出模型高下。", "第二份 233 題考卷含 46 個內容缺口：GLM-5.3-flash 抓到 39 個、gpt-4.1-mini 17 個、Gemini 3.1 Flash-Lite 18 個；gpt 把其中 29 個判成已回答。", "真實一週 150 個搜尋字旁聽，GLM 與 gpt 判斷 87% 一致；19 筆分歧中 GLM 較對約 11 筆、gpt 較對約 4 筆。", "GLM 每判一千題約 1.8 美元、gpt 約 2.5 美元、Jev 約 0.27 美元；GLM 每題 20 到 30 秒，gpt 約 3 秒。", "第二份考卷抽查 20 題：老喬同意 16 題、判斷不出 3 題、認為標錯 1 題（「700 郵局分行代碼」）。"]
categories: ["商業/科技前沿參考"]
tags: ["AI", "模型評測", "Jev", "GLM-5.3-flash", "關鍵字分析", "SEO"]
authorship:
  origin: written
  ai_role: assist
faq: [{"q":"Jev、Clef 這類小模型適合做什麼？","a":"適合選擇題型的判斷：給它固定選項，它挑一個並附上幾成把握，例如文章屬於哪一類、文中提到的名字是不是同一個東西。實測文章分類 Clef 93.5%、Jev 87%，而且它們說有把握的題目幾乎都對，可以先篩一輪、沒把握的再交大模型。它們不會寫字，所以不能做需要抄出原文當證據的工作。"},{"q":"為什麼判斷「站上有沒有答案」要用大模型？","a":"因為要讀懂，不是比字。例如搜「秒聽 缺點」，介紹秒聽的文章主題對得上，但文章沒寫缺點。判讀時要讀多頁內容、判斷有沒有回答到那個點，判有回答還要抄出原句讓程式核對。實測 Jev 單獨做這件事只有 75% 到 79.5%，在 46 個內容缺口上，GLM-5.3-flash 抓到 39 個，原本的 gpt-4.1-mini 只抓到 17 個。"},{"q":"為什麼同一個 AI 考同一份考卷兩次，分數會不一樣？","a":"即使把隨機性設到最低，模型的回答仍有少量不確定。實測 gpt-4.1-mini 同一份 110 題考卷考兩次，約有 6% 的題目答案不同。考卷題數少的時候，差兩三題就差好幾個百分點，所以單考一次的分數不能當結論。"},{"q":"考卷的分數為什麼會騙人？","a":"當正確答案大多是同一個選項時，全部猜那個選項就能拿高分。第一份考卷的測試卷八成答案是「有回答」，全猜就有 77.3%，模型之間看起來都差不多。答案分布偏的時候，要改看「該抓的抓到幾個」和「誤報幾個」。"},{"q":"換成 GLM-5.3-flash 有什麼代價？","a":"主要是慢：每題約 20 到 30 秒，原本的 gpt 約 3 秒；偶爾回覆格式會壞掉，需要重問。費用反而略低，每判一千題約 1.8 美元，原本約 2.5 美元，但這份工作量小，每月差距不到 2 美元，換它的理由是準確度。"}]
changelog: [{"date":"2026.10.11","note":"文章發佈；發文前老喬抽查第二份考卷 20 題答案（同意 16、判斷不出 3、認為標錯 1）；加入四張圖；依老喬意見改寫標題與全文主軸：從「測 Jev 能不能判讀關鍵字」出發，分成選擇題型判斷與「站上有沒有答案」兩種難度，補上做這件事的原因（網站關鍵字分析）與原本的流程","by":"joe+ai"}]
entity_ids:
  author: https://me.joelin.cc/#joe
  publisher: https://me.joelin.cc/#joelincc
---

# 小模型能不能判讀網站關鍵字？選擇題可以，「站上有沒有答案」還是要大模型｜Jev、Clef、GLM 實測

## 摘要

老喬為了網站關鍵字分析，測試小模型 Jev 能否判讀搜尋字。結論是判讀分兩種難度：文章分類、名字比對這類選擇題，閱卷機型的小模型 Jev、Clef 已有八到九成以上準確度，且自報把握可信；判斷「站上有沒有一頁回答這個搜尋字」則需要讀懂並抄出原文，小模型不夠，最後由 GLM-5.3-flash 取代原本的 gpt-4.1-mini，在 233 題考卷的 46 個內容缺口中抓到 39 個（gpt 17 個）。這些模型在 Cloudflare Workers AI 上已串好，價格更低，代價是大模型每題要等 20 到 30 秒。文末整理可複用的考法。

### 重點

- 網站關鍵字分析每週撈出「有人搜、站上可能沒好好回答」的搜尋字，再由 AI 判讀站上有沒有答案；原本使用 gpt-4.1-mini。
- Jev 與 Clef 是只會從選項挑答案、附把握度的閱卷機型小模型，在 Cloudflare Workers AI 上可直接呼叫。
- 文章六選一分類練習卷：GLM-5.3-flash 97.2%／98.1%、Clef 93.5%、Jev 87.0%、gpt-4.1-mini 77.8%／75.9%，全猜為 16.7%。
- 同名不同物 13 題：GLM-5.3-flash 全對、Jev 12 題、Clef 11 題、gpt-4.1-mini 4 題。
- Jev 自報八成以上把握的題目 96% 答對；判讀「站上有沒有答案」時，Jev 單獨測試分數僅 75% 到 79.5%。
- 第一份 110 題考卷的測試卷中，44 題有 34 題正解為「有回答」，全猜即得 77.3%，無法分出模型高下。
- 第二份 233 題考卷含 46 個內容缺口：GLM-5.3-flash 抓到 39 個、gpt-4.1-mini 17 個、Gemini 3.1 Flash-Lite 18 個；gpt 把其中 29 個判成已回答。
- 真實一週 150 個搜尋字旁聽，GLM 與 gpt 判斷 87% 一致；19 筆分歧中 GLM 較對約 11 筆、gpt 較對約 4 筆。
- GLM 每判一千題約 1.8 美元、gpt 約 2.5 美元、Jev 約 0.27 美元；GLM 每題 20 到 30 秒，gpt 約 3 秒。
- 第二份考卷抽查 20 題：老喬同意 16 題、判斷不出 3 題、認為標錯 1 題（「700 郵局分行代碼」）。

結論先講：這篇原本只想測一件事，一個叫 Jev 的小模型，能不能拿來幫我們判讀網站的關鍵字。

測完才發現，「判讀關鍵字」其實是兩種難度完全不一樣的工作。

- 選擇題型的判斷，例如一篇文章該歸哪一類、文中提到的名字是不是同一個東西，Jev 和 Clef 這種小模型已經做得不錯，又快又便宜。
- 要判斷「這個關鍵字想問的事，我們站上有沒有一頁真的回答了」，就複雜很多。小模型不夠，還是要交給會讀、會寫的大模型。這一步我們從 OpenAI 的 gpt-4.1-mini 換成了 GLM-5.3-flash。

順便一個感想：科技進步真的好快。這些模型在 Cloudflare 上都已經串好，接起來非常省事，價格也便宜很多；代價是大模型要多等一點時間。

文中的模型價格與成績是 2026 年 10 月的快照，模型大約幾個月就換一代，日後回頭看請以當期為準。

## 為什麼要做這件事

我們在做網站的關鍵字分析，想從搜尋資料裡回答幾個問題：

- Google 還願意給我們哪些題目曝光？
- 已經有曝光的頁面，還有哪些地方可以再優化？
- Google 正在測試哪些相關性，把哪些搜尋字跟我們的頁面配在一起？
- 搜尋的人除了我們以為的那個字，還會用哪些字詞找同一件事？

這些答案都藏在 Google Search Console 的搜尋字裡。每週我們會撈出一批：有人在搜，Google 也願意把我們的頁面拿出來試，但站上可能沒有一頁好好回答。

把這些字一個一個判斷清楚，就知道該寫新文、補舊文，還是只是 Google 把人送錯了門。說到底，是看懂搜尋的人怎麼想，再照著他們的思考去調整網站。

每週幾百個字，不可能人工一個一個看，所以這個判斷交給 AI。

## 原本怎麼做

九月底剛設計這套流程時，我用的是 OpenAI 的小模型 gpt-4.1-mini，速度快、也夠便宜。

整條流程有五步，只有一步用 AI 讀內容：

1. 進貨：每週從 Google Search Console 拉回搜尋資料。
2. 篩字：留下有一定搜尋量、而且字面上看起來站上沒人談的搜尋字。這一步是程式，不用 AI。
3. 找候選頁：每個搜尋字最多找 7 頁可能有答案的文章，每頁挑最相關的 3 段，打包成一份證據。
4. 判讀：AI 讀這份證據，判斷站上有回答、只答一半，還是沒回答。
5. 入池：依結果分成「不用動」「走錯門」「補舊文」「開新頁」，進每週報表。

```mermaid
flowchart TD
  A["進貨<br/>每週搜尋資料"] --> B["篩字<br/>有搜尋量、站上沒人談"]
  B --> C["找候選頁<br/>最多 7 頁，每頁 3 段"]
  C --> D["判讀<br/>唯一用 AI 讀內容的一步"]
  D --> E["入池<br/>不用動／走錯門<br/>補舊文／開新頁"]
  classDef ai fill:#3a4a9d,stroke:#3a4a9d,color:#ffffff
  class D ai
```

判讀這一步難的地方在於，它要讀懂，不是比字。

舉例來說，有人搜「秒聽 缺點」。我有一篇介紹秒聽的文章，主題完全對得上，但文章裡沒寫缺點。用字面或相似度去比，會說「有了」；真的讀過才知道「沒有」。

所以這一步還有一道防線：AI 判「有回答」的時候，必須把原文那一句抄出來，程式再回頭去文章裡核對，抄不出來就降級。這是為了防 AI 自己編答案。

## 這次想測的：Jev 這種「閱卷機」

Jev 是一種專門做選擇題的小模型。你給它題目和選項，它挑一個，再附上「我有幾成把握」，但不會寫任何字。

它吸引我的地方有三個：

- Jev 很快，一題不到半秒。
- Jev 很便宜，每判一千題不到 0.3 美元，大約是 gpt-4.1-mini 的十分之一。
- Jev 的把握度是算出來的機率，不是它自己說說而已。

我原本想拿它來做主站一千四百多篇文章的自動分類，也想知道它能不能直接接手關鍵字判讀。

它就放在 Cloudflare Workers AI 上。同一個平台上，還有 Cloudflare 自家的閱卷機 Clef、會寫字的 GLM-5.3-flash 和 Qwen3。接好一次之後，換模型幾乎只是改個名字，所以乾脆一起考。後來還加考了 Gemini 3.1 Flash-Lite，當作備援候選。

## 結果一：選擇題，閱卷機已經夠用

先看簡單的那一種。我拿主站文章出了一份分類考卷：給全文，從六個分類挑一個。全部亂猜的分數是 16.7%。

```mermaid
---
config:
  xyChart:
    width: 360
    height: 300
  themeVariables:
    xyChart:
      plotColorPalette: "#3a4a9d, #c0392b"
---
xychart-beta
    title "六選一分類（%）"
    x-axis ["GLM", "Clef", "Jev", "gpt"]
    y-axis 0 --> 100
    bar [97.7, 93.5, 87.0, 76.9]
    line [16.7, 16.7, 16.7, 16.7]
```

上圖每個模型取兩次的平均，紅線是亂猜的 16.7%。大模型 GLM 最準，但閱卷機 Clef 和 Jev 也都在八成五以上；反而是原本的 gpt-4.1-mini 最差。

另一份考卷是判斷文章裡提到的名字，是不是知識庫裡的同一個東西。最難的是「同名不同物」13 題：GLM 全對，Jev 對 12 題，Clef 對 11 題，gpt 只對 4 題。例如一篇在講 Terra 區塊鏈的文章，gpt 也說「有提到地球」，因為名字都叫 Terra。

閱卷機最有價值的，是它知道自己什麼時候可信。Jev 說自己有八成以上把握的題目，96% 是對的；Clef 有把握的分類題幾乎全對。

所以選擇題型的工作可以這樣分：閱卷機先判一輪，有把握的直接採用，沒把握的再交大模型。用分類考卷模擬，準確度跟大模型單獨做差不多，大模型要判的題目少了六成。

這兩份目前還是練習卷，正式測試卷還沒開，所以先當方向參考。

## 結果二：「站上有沒有答案」，閱卷機不夠

難的那一種，就是我們的關鍵字判讀：讀好幾頁內容，判斷有沒有回答到搜尋的人想問的那個點，判有回答還要抄出原句。

閱卷機不會寫字，抄不出原句，最多只能當第一道篩子。Jev 單獨考這份工作，測試卷只有 75% 到 79.5%，不夠。

會寫字的模型之間，第一份考卷卻考不太出差別。

這份考卷有 110 個搜尋字，分成練習卷和測試卷。後來我把答案重數一遍，才發現測試卷 44 題裡有 34 題的正確答案是「有回答」，全部猜「有回答」就能拿 77.3%。

```mermaid
---
config:
  xyChart:
    width: 360
    height: 300
  themeVariables:
    xyChart:
      plotColorPalette: "#3a4a9d, #c0392b"
---
xychart-beta
    title "測試卷平均 vs 全猜線"
    x-axis ["GLM", "gpt", "Jev", "Clef"]
    y-axis 0 --> 100
    bar [83.0, 80.1, 77.3, 70.5]
    line [77.3, 77.3, 77.3, 77.3]
```

上圖藍色長條是各模型在第一份測試卷的平均分數（gpt 取四次平均，其他取兩次），紅線是全猜的 77.3%。大家都貼著這條線，Jev 剛好壓在線上。還有一個 Clef-flash，110 題裡有 102 題答「有回答」，測試卷照樣拿到 79.5%，它不是比較懂，是在矇。

這份考卷像一張答案九成是「是」的是非題，全圈「是」就快及格了，分不出誰真的會。

於是我們重出一份考卷。從真實的每週清單裡抽 233 個搜尋字，刻意多收「答一半」和「沒回答」的題目，由另一組 AI 助理讀網站全文標答案，標的時候看不到任何模型的判斷。裡面有 46 個真正該處理的內容缺口。

```mermaid
---
config:
  xyChart:
    width: 360
    height: 300
  themeVariables:
    xyChart:
      plotColorPalette: "#3a4a9d"
---
xychart-beta
    title "46 個缺口抓到幾個"
    x-axis ["GLM", "GLM低", "Gemini", "gpt"]
    y-axis 0 --> 50
    bar [39, 34, 18, 17]
```

GLM 抓到 39 個，原本的 gpt 只抓到 17 個（再考一次是 21 個）。「GLM低」是同一個 GLM 把「想多久」調低的版本。把站上明明有答、卻被說成沒答的誤報算進去，兩邊差不多，都是二十個上下。

gpt 錯在哪裡很清楚：46 個缺口裡，它把 29 個判成「已經回答了」，只要文章主題對得上就放行。Gemini 也是同一個毛病，很穩定、很少誤報，但一樣放走一大半。

也就是說，過去幾週我拿到的待寫清單，漏掉了六成以上真正該寫的題目，而我完全不知道。

正式換之前，我們還讓 GLM 在旁邊旁聽了真實的一週：同一週 150 個搜尋字，兩邊 87% 判斷一致。不一致的 19 個逐筆看過：

- GLM 比較對的大約 11 個。例如「兩村照片」其實是「兩吋照片」打錯字，gpt 判沒答，GLM 認出來了；「畫框尺寸」被送到的那頁其實在講相框，GLM 沒有放行。
- gpt 比較對的大約 4 個。像「101 年是西元幾年」，答案在民國對照表裡，但給的段落沒截到那一列。這是證據截短的問題，不是模型的問題。

另外也試過不換模型、改證據的做法，例如在證據上註明 Google 把人送到哪一頁，或把段落切得更細，都沒有比換模型有效，最後沒採用。

## 最後怎麼分工

測完之後，判讀關鍵字這件事分成兩條線：

- 選擇題型的判斷，例如文章分類、名字比對，之後還有搜尋意圖這類，用閱卷機先篩、沒把握的交大模型。分類清單還在定，定了才上線。
- 「站上有沒有答案」的判讀，換成 GLM-5.3-flash，抄原句的防線照舊；回覆格式偶爾壞掉，就同一個模型把「想多久」調低重問一次。
- 文章配圖和段落向量照舊用 OpenAI，這兩項跟這次考的是不同能力，沒有證據就不換。

代價是等。gpt 每題約 3 秒，GLM 每題要 20 到 30 秒，每週那一批要多跑 5 到 20 分鐘。

錢反而不是重點。GLM 每判一千題約 1.8 美元，gpt 約 2.5 美元，扣掉多跑的時間，估計每個月只省 0.5 到 1.7 美元。換它是因為它抓得到原本抓不到的東西。

回頭看，這件事讓我最有感的是速度。九月底設計流程時，我直接用了 OpenAI 的模型；才過一個月，Cloudflare 上已經有一整排模型串好可以直接叫，閱卷機便宜到幾乎不用算錢，大模型也比原本便宜三成左右。整輪考試，所有模型費加起來大約 11 美元。

## 這次學到的考法

如果你也想替自己的工作挑一個 AI，這幾條可以直接拿去用：

1. 先分清楚工作是哪一種：從固定選項挑答案，還是要讀懂內容、寫出理由。前者可以先試便宜的閱卷機，後者要用會寫字的模型。
2. 自己出考卷，答案要讀過原始資料才標，標的人不能先看到任何模型的答案。
3. 考卷分成練習卷和測試卷，練習卷可以拿來調，測試卷只在最後開一次。
4. 考之前先寫好過關線和「考出什麼結果就怎麼做」，免得考完才找理由。
5. 每個設定至少考兩次。以 gpt-4.1-mini 為例，同一份考卷、隨機性設成最低，兩次仍有約 6% 的答案不一樣。
6. 先算「全部猜同一個答案」能拿幾分。答案分布太偏的時候，改看該抓的抓到幾個、誤報幾個。我們的第一份考卷就栽在這裡。
7. 會回報把握度的模型，先看它的把握準不準，比看總分更有用。
8. 正式換之前先旁聽：拿真實的一週，新舊並跑、結果不動，逐筆看兩邊不一樣的地方。
9. 一次只改一件事，換模型、改寫法、改證據分開考，才知道改善從哪裡來。

## 這次考試的限制

有幾件事要先講清楚：

- 兩份判讀考卷的答案都是 AI 讀全文標的，不是我一題一題標的。發文前我自己抽看了第二份考卷的 20 題（14 題缺口、6 題有回答）：16 題我同意，3 題我也判斷不出來，1 題我認為標錯。標錯的那題是「700 郵局分行代碼」，AI 標成只答一半，理由是文章沒給郵局的 7 碼分行代碼；但我覺得搜這個字的人要的就是 700，文章已經回答了。
- 分類和名字判斷那兩份，測試卷還沒開。
- 正式換上 GLM 的第一班，排在 10 月 14 日。實際花了多少、跑了多久、重問幾次，跑完會補在更新日誌裡。

延伸閱讀：上個月我算過要不要買一台機器在家跑開源模型（[我差點花 40 萬買一台跑不贏AI雲端訂閱的機器](/p/9757)），結論是分類、判斷這類工作用便宜的模型就夠。這篇算是那個結論的實測版，也補上一句：要讀懂內容的判斷，還是得用大一點的模型。我的 AI 員工各自在做什麼，則寫在[老喬的31位AI員工在幹嘛？](/p/9861)。

本文關鍵字：小模型、Jev、Clef、GLM-5.3-flash、gpt-4.1-mini、Cloudflare Workers AI、關鍵字分析、AI 判讀、模型評測、SEO
