本篇目錄(11 節)
結論先講:這篇原本只想測一件事,一個叫 Jev 的小模型,能不能拿來幫我們判讀網站的關鍵字。
測完才發現,「判讀關鍵字」其實是兩種難度完全不一樣的工作。
- 選擇題型的判斷,例如一篇文章該歸哪一類、文中提到的名字是不是同一個東西,Jev 和 Clef 這種小模型已經做得不錯,又快又便宜。
- 要判斷「這個關鍵字想問的事,我們站上有沒有一頁真的回答了」,就複雜很多。小模型不夠,還是要交給會讀、會寫的大模型。這一步我們從 OpenAI 的 gpt-4.1-mini 換成了 GLM-5.3-flash。
順便一個感想:科技進步真的好快。這些模型在 Cloudflare 上都已經串好,接起來非常省事,價格也便宜很多;代價是大模型要多等一點時間。
文中的模型價格與成績是 2026 年 10 月的快照,模型大約幾個月就換一代,日後回頭看請以當期為準。
為什麼要做這件事
我們在做網站的關鍵字分析,想從搜尋資料裡回答幾個問題:
- Google 還願意給我們哪些題目曝光?
- 已經有曝光的頁面,還有哪些地方可以再優化?
- Google 正在測試哪些相關性,把哪些搜尋字跟我們的頁面配在一起?
- 搜尋的人除了我們以為的那個字,還會用哪些字詞找同一件事?
這些答案都藏在 Google Search Console 的搜尋字裡。每週我們會撈出一批:有人在搜,Google 也願意把我們的頁面拿出來試,但站上可能沒有一頁好好回答。
把這些字一個一個判斷清楚,就知道該寫新文、補舊文,還是只是 Google 把人送錯了門。說到底,是看懂搜尋的人怎麼想,再照著他們的思考去調整網站。
每週幾百個字,不可能人工一個一個看,所以這個判斷交給 AI。
原本怎麼做
九月底剛設計這套流程時,我用的是 OpenAI 的小模型 gpt-4.1-mini,速度快、也夠便宜。
整條流程有五步,只有一步用 AI 讀內容:
- 進貨:每週從 Google Search Console 拉回搜尋資料。
- 篩字:留下有一定搜尋量、而且字面上看起來站上沒人談的搜尋字。這一步是程式,不用 AI。
- 找候選頁:每個搜尋字最多找 7 頁可能有答案的文章,每頁挑最相關的 3 段,打包成一份證據。
- 判讀:AI 讀這份證據,判斷站上有回答、只答一半,還是沒回答。
- 入池:依結果分成「不用動」「走錯門」「補舊文」「開新頁」,進每週報表。
flowchart TD A["進貨<br/>每週搜尋資料"] --> B["篩字<br/>有搜尋量、站上沒人談"] B --> C["找候選頁<br/>最多 7 頁,每頁 3 段"] C --> D["判讀<br/>唯一用 AI 讀內容的一步"] D --> E["入池<br/>不用動/走錯門<br/>補舊文/開新頁"] classDef ai fill:#3a4a9d,stroke:#3a4a9d,color:#ffffff class D ai
判讀這一步難的地方在於,它要讀懂,不是比字。
舉例來說,有人搜「秒聽 缺點」。我有一篇介紹秒聽的文章,主題完全對得上,但文章裡沒寫缺點。用字面或相似度去比,會說「有了」;真的讀過才知道「沒有」。
所以這一步還有一道防線:AI 判「有回答」的時候,必須把原文那一句抄出來,程式再回頭去文章裡核對,抄不出來就降級。這是為了防 AI 自己編答案。
這次想測的:Jev 這種「閱卷機」
Jev 是一種專門做選擇題的小模型。你給它題目和選項,它挑一個,再附上「我有幾成把握」,但不會寫任何字。
它吸引我的地方有三個:
- Jev 很快,一題不到半秒。
- Jev 很便宜,每判一千題不到 0.3 美元,大約是 gpt-4.1-mini 的十分之一。
- Jev 的把握度是算出來的機率,不是它自己說說而已。
我原本想拿它來做主站一千四百多篇文章的自動分類,也想知道它能不能直接接手關鍵字判讀。
它就放在 Cloudflare Workers AI 上。同一個平台上,還有 Cloudflare 自家的閱卷機 Clef、會寫字的 GLM-5.3-flash 和 Qwen3。接好一次之後,換模型幾乎只是改個名字,所以乾脆一起考。後來還加考了 Gemini 3.1 Flash-Lite,當作備援候選。
結果一:選擇題,閱卷機已經夠用
先看簡單的那一種。我拿主站文章出了一份分類考卷:給全文,從六個分類挑一個。全部亂猜的分數是 16.7%。
---
config:
xyChart:
width: 360
height: 300
themeVariables:
xyChart:
plotColorPalette: "#3a4a9d, #c0392b"
---
xychart-beta
title "六選一分類(%)"
x-axis ["GLM", "Clef", "Jev", "gpt"]
y-axis 0 --> 100
bar [97.7, 93.5, 87.0, 76.9]
line [16.7, 16.7, 16.7, 16.7]
上圖每個模型取兩次的平均,紅線是亂猜的 16.7%。大模型 GLM 最準,但閱卷機 Clef 和 Jev 也都在八成五以上;反而是原本的 gpt-4.1-mini 最差。
另一份考卷是判斷文章裡提到的名字,是不是知識庫裡的同一個東西。最難的是「同名不同物」13 題:GLM 全對,Jev 對 12 題,Clef 對 11 題,gpt 只對 4 題。例如一篇在講 Terra 區塊鏈的文章,gpt 也說「有提到地球」,因為名字都叫 Terra。
閱卷機最有價值的,是它知道自己什麼時候可信。Jev 說自己有八成以上把握的題目,96% 是對的;Clef 有把握的分類題幾乎全對。
所以選擇題型的工作可以這樣分:閱卷機先判一輪,有把握的直接採用,沒把握的再交大模型。用分類考卷模擬,準確度跟大模型單獨做差不多,大模型要判的題目少了六成。
這兩份目前還是練習卷,正式測試卷還沒開,所以先當方向參考。
結果二:「站上有沒有答案」,閱卷機不夠
難的那一種,就是我們的關鍵字判讀:讀好幾頁內容,判斷有沒有回答到搜尋的人想問的那個點,判有回答還要抄出原句。
閱卷機不會寫字,抄不出原句,最多只能當第一道篩子。Jev 單獨考這份工作,測試卷只有 75% 到 79.5%,不夠。
會寫字的模型之間,第一份考卷卻考不太出差別。
這份考卷有 110 個搜尋字,分成練習卷和測試卷。後來我把答案重數一遍,才發現測試卷 44 題裡有 34 題的正確答案是「有回答」,全部猜「有回答」就能拿 77.3%。
---
config:
xyChart:
width: 360
height: 300
themeVariables:
xyChart:
plotColorPalette: "#3a4a9d, #c0392b"
---
xychart-beta
title "測試卷平均 vs 全猜線"
x-axis ["GLM", "gpt", "Jev", "Clef"]
y-axis 0 --> 100
bar [83.0, 80.1, 77.3, 70.5]
line [77.3, 77.3, 77.3, 77.3]
上圖藍色長條是各模型在第一份測試卷的平均分數(gpt 取四次平均,其他取兩次),紅線是全猜的 77.3%。大家都貼著這條線,Jev 剛好壓在線上。還有一個 Clef-flash,110 題裡有 102 題答「有回答」,測試卷照樣拿到 79.5%,它不是比較懂,是在矇。
這份考卷像一張答案九成是「是」的是非題,全圈「是」就快及格了,分不出誰真的會。
於是我們重出一份考卷。從真實的每週清單裡抽 233 個搜尋字,刻意多收「答一半」和「沒回答」的題目,由另一組 AI 助理讀網站全文標答案,標的時候看不到任何模型的判斷。裡面有 46 個真正該處理的內容缺口。
---
config:
xyChart:
width: 360
height: 300
themeVariables:
xyChart:
plotColorPalette: "#3a4a9d"
---
xychart-beta
title "46 個缺口抓到幾個"
x-axis ["GLM", "GLM低", "Gemini", "gpt"]
y-axis 0 --> 50
bar [39, 34, 18, 17]
GLM 抓到 39 個,原本的 gpt 只抓到 17 個(再考一次是 21 個)。「GLM低」是同一個 GLM 把「想多久」調低的版本。把站上明明有答、卻被說成沒答的誤報算進去,兩邊差不多,都是二十個上下。
gpt 錯在哪裡很清楚:46 個缺口裡,它把 29 個判成「已經回答了」,只要文章主題對得上就放行。Gemini 也是同一個毛病,很穩定、很少誤報,但一樣放走一大半。
也就是說,過去幾週我拿到的待寫清單,漏掉了六成以上真正該寫的題目,而我完全不知道。
正式換之前,我們還讓 GLM 在旁邊旁聽了真實的一週:同一週 150 個搜尋字,兩邊 87% 判斷一致。不一致的 19 個逐筆看過:
- GLM 比較對的大約 11 個。例如「兩村照片」其實是「兩吋照片」打錯字,gpt 判沒答,GLM 認出來了;「畫框尺寸」被送到的那頁其實在講相框,GLM 沒有放行。
- gpt 比較對的大約 4 個。像「101 年是西元幾年」,答案在民國對照表裡,但給的段落沒截到那一列。這是證據截短的問題,不是模型的問題。
另外也試過不換模型、改證據的做法,例如在證據上註明 Google 把人送到哪一頁,或把段落切得更細,都沒有比換模型有效,最後沒採用。
最後怎麼分工
測完之後,判讀關鍵字這件事分成兩條線:
- 選擇題型的判斷,例如文章分類、名字比對,之後還有搜尋意圖這類,用閱卷機先篩、沒把握的交大模型。分類清單還在定,定了才上線。
- 「站上有沒有答案」的判讀,換成 GLM-5.3-flash,抄原句的防線照舊;回覆格式偶爾壞掉,就同一個模型把「想多久」調低重問一次。
- 文章配圖和段落向量照舊用 OpenAI,這兩項跟這次考的是不同能力,沒有證據就不換。
代價是等。gpt 每題約 3 秒,GLM 每題要 20 到 30 秒,每週那一批要多跑 5 到 20 分鐘。
錢反而不是重點。GLM 每判一千題約 1.8 美元,gpt 約 2.5 美元,扣掉多跑的時間,估計每個月只省 0.5 到 1.7 美元。換它是因為它抓得到原本抓不到的東西。
回頭看,這件事讓我最有感的是速度。九月底設計流程時,我直接用了 OpenAI 的模型;才過一個月,Cloudflare 上已經有一整排模型串好可以直接叫,閱卷機便宜到幾乎不用算錢,大模型也比原本便宜三成左右。整輪考試,所有模型費加起來大約 11 美元。
這次學到的考法
如果你也想替自己的工作挑一個 AI,這幾條可以直接拿去用:
- 先分清楚工作是哪一種:從固定選項挑答案,還是要讀懂內容、寫出理由。前者可以先試便宜的閱卷機,後者要用會寫字的模型。
- 自己出考卷,答案要讀過原始資料才標,標的人不能先看到任何模型的答案。
- 考卷分成練習卷和測試卷,練習卷可以拿來調,測試卷只在最後開一次。
- 考之前先寫好過關線和「考出什麼結果就怎麼做」,免得考完才找理由。
- 每個設定至少考兩次。以 gpt-4.1-mini 為例,同一份考卷、隨機性設成最低,兩次仍有約 6% 的答案不一樣。
- 先算「全部猜同一個答案」能拿幾分。答案分布太偏的時候,改看該抓的抓到幾個、誤報幾個。我們的第一份考卷就栽在這裡。
- 會回報把握度的模型,先看它的把握準不準,比看總分更有用。
- 正式換之前先旁聽:拿真實的一週,新舊並跑、結果不動,逐筆看兩邊不一樣的地方。
- 一次只改一件事,換模型、改寫法、改證據分開考,才知道改善從哪裡來。
這次考試的限制
有幾件事要先講清楚:
- 兩份判讀考卷的答案都是 AI 讀全文標的,不是我一題一題標的。發文前我自己抽看了第二份考卷的 20 題(14 題缺口、6 題有回答):16 題我同意,3 題我也判斷不出來,1 題我認為標錯。標錯的那題是「700 郵局分行代碼」,AI 標成只答一半,理由是文章沒給郵局的 7 碼分行代碼;但我覺得搜這個字的人要的就是 700,文章已經回答了。
- 分類和名字判斷那兩份,測試卷還沒開。
- 正式換上 GLM 的第一班,排在 10 月 14 日。實際花了多少、跑了多久、重問幾次,跑完會補在更新日誌裡。
延伸閱讀:上個月我算過要不要買一台機器在家跑開源模型(我差點花 40 萬買一台跑不贏AI雲端訂閱的機器),結論是分類、判斷這類工作用便宜的模型就夠。這篇算是那個結論的實測版,也補上一句:要讀懂內容的判斷,還是得用大一點的模型。我的 AI 員工各自在做什麼,則寫在老喬的31位AI員工在幹嘛?。
本文關鍵字:小模型、Jev、Clef、GLM-5.3-flash、gpt-4.1-mini、Cloudflare Workers AI、關鍵字分析、AI 判讀、模型評測、SEO
本篇摘要
老喬為了網站關鍵字分析,測試小模型 Jev 能否判讀搜尋字。結論是判讀分兩種難度:文章分類、名字比對這類選擇題,閱卷機型的小模型 Jev、Clef 已有八到九成以上準確度,且自報把握可信;判斷「站上有沒有一頁回答這個搜尋字」則需要讀懂並抄出原文,小模型不夠,最後由 GLM-5.3-flash 取代原本的 gpt-4.1-mini,在 233 題考卷的 46 個內容缺口中抓到 39 個(gpt 17 個)。這些模型在 Cloudflare Workers AI 上已串好,價格更低,代價是大模型每題要等 20 到 30 秒。文末整理可複用的考法。
- 網站關鍵字分析每週撈出「有人搜、站上可能沒好好回答」的搜尋字,再由 AI 判讀站上有沒有答案;原本使用 gpt-4.1-mini。
- Jev 與 Clef 是只會從選項挑答案、附把握度的閱卷機型小模型,在 Cloudflare Workers AI 上可直接呼叫。
- 文章六選一分類練習卷:GLM-5.3-flash 97.2%/98.1%、Clef 93.5%、Jev 87.0%、gpt-4.1-mini 77.8%/75.9%,全猜為 16.7%。
- 同名不同物 13 題:GLM-5.3-flash 全對、Jev 12 題、Clef 11 題、gpt-4.1-mini 4 題。
- Jev 自報八成以上把握的題目 96% 答對;判讀「站上有沒有答案」時,Jev 單獨測試分數僅 75% 到 79.5%。
- 第一份 110 題考卷的測試卷中,44 題有 34 題正解為「有回答」,全猜即得 77.3%,無法分出模型高下。
- 第二份 233 題考卷含 46 個內容缺口:GLM-5.3-flash 抓到 39 個、gpt-4.1-mini 17 個、Gemini 3.1 Flash-Lite 18 個;gpt 把其中 29 個判成已回答。
- 真實一週 150 個搜尋字旁聽,GLM 與 gpt 判斷 87% 一致;19 筆分歧中 GLM 較對約 11 筆、gpt 較對約 4 筆。
- GLM 每判一千題約 1.8 美元、gpt 約 2.5 美元、Jev 約 0.27 美元;GLM 每題 20 到 30 秒,gpt 約 3 秒。
- 第二份考卷抽查 20 題:老喬同意 16 題、判斷不出 3 題、認為標錯 1 題(「700 郵局分行代碼」)。
想看更多網站經營實測?
真實數字,每週一封寄給你
