誰在讀你的網站?AI 時代的四種爬蟲,用我自家一週七萬次紀錄拆給你看

2026-08-20 | 商業/科技前沿參考 數位行銷 | 4 minutes of reading

本篇摘要

本文以作者自有網站 2026 年 8 月 13 至 19 日共七天的 Cloudflare zone 層請求紀錄為樣本,說明 AI 時代網站訪客結構的變化與四種爬蟲的差異。全站群七天收到約 69,900 次已識別機器請求,日均約一萬次,主站佔 47,074 次。僅計主站網頁類請求時,機器一週約 28,300 次、人類約 6,300 次,機器約為人類的 4.5 倍。Cloudflare 將 AI 相關機器人分為四類,本文收斂為三層:索引層(Search Engine 的 Googlebot、BingBot 與 AI Search 的 OAI-SearchBot、PerplexityBot、Applebot,功能是建索引)、訓練層(AI Crawler 的 GPTBot、ClaudeBot、Meta-ExternalAgent、Bytespider,功能是收集訓練語料)、即時取用層(AI Assistant 的 ChatGPT-User、Claude-User、Perplexity-User,僅在真人提問當下觸發)。關鍵區分在於 AI Assistant 是 AI 公司的伺服器代替使用者讀取網頁,人類本身並未造訪,因此 GA 這類 JS beacon 工具無法量測。三層七天數據為訓練層 30,996 次佔 44%、Search Engine 19,798 次佔 28%、AI Search 12,032 次佔 17%、AI Assistant 7,087 次佔 10%。單隻機器人以 Meta-ExternalAgent 日均 2,735 次居冠,超過 Googlebot 的 1,875 次。作者站的 crawl-to-refer 比約 2,200 比 1,其中 OpenAI 約 1,900 比 1、Perplexity 約 1,500 比 1、Anthropic 約 8,200 比 1(Claude App 不帶 referer 標頭導致分母低估)。即時取用層七天涵蓋 268 個文章網址,全站 1,058 篇約四分之一被 AI 實際取用,其中前九名有八篇為台灣財富數據類文章。圖片資產同樣被大量開採,圖片網域七天被抓 12,890 次,其中 Meta-ExternalAgent 抓取 3,349 張不同圖片。產業對照為 Imperva 2025 Bad Bot Report 指出 2024 年自動化流量佔全網 51%,十年來首度超過人類。

  • 2024 年自動化流量佔全網 51%,十年來首度超過人類(Imperva 2025 Bad Bot Report)
  • 作者站主站網頁類請求,機器一週約 28,300 次、人類約 6,300 次,機器是人的 4.5 倍
  • AI Assistant(ChatGPT-User 等)是 AI 公司的伺服器代替使用者讀網頁,人類本人並未造訪,GA 看不到這一段
  • 四類機器人收斂成三層:索引層決定找不找得到你、訓練層決定未來模型認不認識你、即時取用層顯示此刻有多少真人問題打到你
  • 來訪最勤的不是 Googlebot 而是 Meta 的訓練爬蟲,日均 2,735 次對 1,875 次
  • 作者站 crawl-to-refer 比約 2,200 比 1,即 AI 每讀走 2,200 頁才換回 1 個真人點擊
  • 全站 1,058 篇文章,一週內約四分之一被 AI 即時取用組答案
  • 圖片同樣是被開採的資產,圖片網域七天被抓 12,890 次,Meta 一家就抓了 3,349 張不同的圖
本篇目錄(21 節)
  1. 網路是一片汪洋,你的網站是一座島
  2. 為什麼現在非談不可:機器已經比人多
  3. 最容易搞混的一件事:AI 助理不是人類
  4. 四種機器人,其實是三層
  5. 索引層:讓 AI 找得到你
  6. 訓練層:把你吃進未來的模型
  7. 即時取用層:真人正在問,AI 當場來讀
  8. 一個提問的完整旅程
  9. 拿走多少,還你多少
  10. 實測:一週七萬次,誰來得最勤
  11. AI 眼中的老喬報,是一座台灣財富數據庫
  12. 圖片也在被開採
  13. 那到底該看什麼指標
  14. 一句話總結
  15. 資料來源
  16. 一、各家官方的機器人說明
  17. 二、產業研究與指標定義
  18. 三、本文自有數據
  19. 訂閱更多關於 老喬報 joelin.cc 的消息
  20. 備註與警語
  21. 文章更新日誌

先講結論:現在來讀你網站的,大部分不是人。

我把自家站群一週的邊緣紀錄整個攤開來看,2026 年 8 月 13 日到 19 日這七天,總共收到約 69,900 次機器造訪,平均一天一萬次。同一時間換算成人類的瀏覽量,大約是機器的四分之一——換句話說,每 10 次網頁被讀取,大約 8 次是機器在讀。

更重要的是,這些機器不是同一種東西。它們分成四類、三個層次,各自在做完全不同的事,時間尺度也完全不同。分不清楚,就會拿錯的數字去解讀自己的內容表現。

這篇把四種機器人講清楚,然後用我自己網站的實際數字,說明在 AI 時代該怎麼看「我的內容到底有沒有被看見」。

誰在讀你的網站?一週 69,900 次造訪,機器是人的四倍,分成索引層、訓練層、即時取用層三種 AI 爬蟲

網路是一片汪洋,你的網站是一座島

先想一個最根本的問題:Google 也好、ChatGPT 也好,它憑什麼知道你的網站上有一篇談某個主題的文章?

網路是一片汪洋,你的網站是海上的一座島。島上有什麼,外面沒有任何人知道。所以每一家搜尋引擎、每一家 AI 公司,都會派先遣部隊出海——一隊一隊的探勘船,逐島登陸,把島上有什麼記錄下來,並且開採一部分樣本帶回去存檔。存了檔,總部才會知道:那邊有一座島,上面有這類資料,以後有需要可以去那裡拿。

這就是爬蟲(crawler,也叫 bot)在做的事。沒有被探勘過的島,等於不存在——不管島上的東西多好,沒人來記錄過,就永遠不會有後續。

所有 AI 時代的可見度,都從「先遣部隊有沒有來、來得多勤、開採了多少」開始算。

而重點來了:這些探勘船上沒有人類,從頭到尾都是機器。真正的人類要到整條故事的最後一步才可能出現。

為什麼現在非談不可:機器已經比人多

這件事變成議題,不是因為 AI 很流行,而是因為網路的訪客結構整個翻過去了。

資安公司 Imperva(Thales 集團)的《2025 Bad Bot Report》是連續第 12 年的年度調查,結論是 2024 年自動化流量佔全網 51%,十年來首度超過人類,其中惡意 bot 佔 37%。報告把成因直接指向大型語言模型的普及:AI 讓做 bot 的門檻大幅降低,同時 AI 公司自己也派出了史上規模最大的爬蟲艦隊。

我自己網站的數字更誇張。只算主站的網頁類請求(首頁與文章頁,排除 CSS、JS 這類靜態檔案):

訪客 一週讀取次數
機器(四類已識別 bot) 約 28,300
人類(GA4 瀏覽量換算) 約 6,300

機器約為人類的 4.5 倍。而且這還是保守估計——GA4 本身會低估人類(擋廣告、拒絕 cookie 的人不計),但邊緣紀錄這邊也只算得到「有自報身分的已知機器人」,沒自報的不在裡面。

要說明的是,這兩個數字來自不同的時間窗與不同的量測系統,一個是月粒度的網頁分析、一個是日粒度的邊緣請求紀錄,所以只能做量級比較,不是精確對帳。但四倍這個量級不會因為口徑不同而變成一倍。

最容易搞混的一件事:AI 助理不是人類

假設有人今天在 ChatGPT 問「台灣人存款中位數是多少」,而你的文章最後出現在答案裡。這件事其實包含兩個完全不同的動作。

第一個動作是 ChatGPT 的伺服器當場連到你的網站,把文章抓回去讀,組成答案。這次來訪的「訪客」是 OpenAI 機房裡的一台電腦,它自報的身分叫 ChatGPT-User。那個提問的人類,從頭到尾沒有踏進你的網站。

第二個動作是,如果答案下面附了連結、而且那個人真的點了,這時他才用自己的瀏覽器登島。這才是你在 GA 裡看到的 ChatGPT 來源流量。

比較 AI 助理抓取 GA 的 AI 來源流量
來的是誰 AI 公司的伺服器 人類本人的瀏覽器
人類有沒有到你網站 沒有
GA 看得到嗎 看不到 看得到

差別的關鍵在於:機器不會執行網頁裡的追蹤程式碼,所以 GA 這類工具天生看不見它們。你必須從 CDN 或伺服器的請求紀錄才看得到。

所謂「AI 助理是使用者主動觸發的行為」,意思不是「使用者來了」,而是這隻機器人只在真人提問的那一秒才被觸發,平常不存在,不像一般爬蟲整天在掃。這是 OpenAI 官方文件的說法:當使用者向 ChatGPT 提問時,它可能以 ChatGPT-User 造訪網頁,而 ChatGPT-User 不做自動化爬網。Anthropic 的 Claude-User、Perplexity 的 Perplexity-User,官方定義都是同一個結構。

在零點擊已成常態的今天,第一個動作天天大量發生,第二個動作很少發生。只看 GA,等於只看漏斗最後漏下來的幾滴水,卻看不到漏斗口的整桶水。

四種機器人,其實是三層

Cloudflare 把 AI 相關機器人分成四類,分類依據是各家公司自己宣告的用途。但理解上應該收成三層,因為其中兩類做的是同一件事。

機器人其實分三層:索引層先畫地圖讓 AI 找得到你、訓練層開採內容餵給未來的模型、即時取用層是真人正在問 AI 當場來讀

索引層:讓 AI 找得到你

這一層包含兩類機器人:

  • 傳統搜尋引擎(Search Engine):Googlebot、BingBot。
  • AI 搜尋(AI Search):OAI-SearchBot、PerplexityBot、Applebot。

這兩類是同一層,因為它們爬的動作一模一樣,都在建「哪座島有什麼」的地圖。差別只在地圖交給誰用。Googlebot 的地圖產出十條藍色連結,等人類自己點;OAI-SearchBot 的地圖產出候選島嶼名單,餵給第三層的 AI 助理去讀。

舉個例子就清楚了。你在 ChatGPT 開搜尋功能問問題,它的第一步是查 OAI-SearchBot 建好的地圖——這題有哪幾座島有料?查到你,才有下一步。沒被 AI 搜尋爬過,等於不在地圖上,AI 想用你也找不到你。

順帶澄清一個常見誤會:AI 搜尋不等於訓練。Perplexity 的官方文件明講 PerplexityBot 不用於為 AI 基礎模型抓取內容。索引是索引,訓練是訓練。

訓練層:把你吃進未來的模型

代表是 GPTBot、ClaudeBot、Meta-ExternalAgent、Bytespider。

這批船不是來畫地圖的,是來開採礦產的——把內容整批搬回去,當作未來模型的教材。GPTBot 的官方描述是「用來抓取可能被用於訓練我們生成式 AI 基礎模型的內容」,ClaudeBot 的描述同義。

你的文章被吃進去之後,要等下一代模型訓練完上線才可能生效,而且你永遠無法證明它真的用了你這篇。時間尺度是數月以上,完全黑箱。

即時取用層:真人正在問,AI 當場來讀

代表是 ChatGPT-User、Claude-User、Perplexity-User。

這就是前一節講的那一層:真人提問的那一秒才觸發,當場登島讀那一頁、組答案。這是三層裡唯一與需求同步發生的一層。

三層各自回答一個不同的問題。索引層決定「找不找得到你」,訓練層決定「未來的模型認不認識你」,即時取用層顯示「此刻有多少真人的問題打到你」。

一個提問的完整旅程

把三層放進時間軸,一次提問的旅程大概是這樣:

  1. 幾個月前,訓練層把你的文章吃進語料。這一段量得到抓取,但效果不可證。
  2. 幾週前,索引層把你的文章編進地圖。這一段量得到抓取。
  3. 此刻,真人提問,即時取用層當場來讀你的頁。這是唯一即時可量測的訊號。
  4. 幾秒後,答案生成,可能引用你、也可能沒有。這一段大多不可見。
  5. 極少數情況下,真人點了連結過來。這才是 GA 的 AI 來源流量。

每往下一層,量級掉一截、可見度也掉一截。GA 量的是最後一層,也是最小的一層。

拿走多少,還你多少

Cloudflare 提出過一個指標叫 crawl-to-refer ratio,中文可以叫「爬取回饋比」:AI 平台每爬走幾頁,才送回一個人類點擊。

我用自家數字算了一輪(只計 AI 三類,排除 Googlebot 與 BingBot):

平台 AI 讀取(換算每月) 回流人次(當月) 約略比值
OpenAI 約 31,600 17 約 1,900:1
Anthropic 約 8,200 1 約 8,200:1
Perplexity 約 6,000 4 約 1,500:1
合計 約 81,000 37 約 2,200:1

這張表要配兩個但書才能讀。Anthropic 那一格特別失真,因為 Claude 的桌面版與 App 送出的連結不帶 referer 標頭,分析工具根本認不出來,所以分母被系統性低估——這是 Cloudflare 官方在原始文章裡就點名的量測限制。另外,表中兩欄同樣來自不同時間窗的換算,只看量級。

AI 拿走多少還你多少:本站實測每 2,200 頁被 AI 讀走,才換回 1 個真人點進來,零點擊不是意外而是新的常態

這個量級並不特殊。Cloudflare 官方在 2025 年 6 月某一週的實測,Anthropic 一度是 70,900 比 1;後續各方在不同窗口下算出的數字,從幾百比一到數千比一都有。差異大到單一數字沒有意義,但方向完全一致:AI 拿走的遠多於送回來的。

所以結論不是「AI 沒帶流量、別理它」,而是服務對象換人了。

  • 人類問問題的入口,越來越多不在搜尋框,而在對話框。他們照樣在問一樣的問題,只是這次替他們跑腿的是機器。
  • 機器不看排版、不看動線、不點按鈕,只看內容本身好不好取用。傳統 SEO 有一半是在服務人類的行為,AI 這一側只剩下你的資料乾不乾淨、好不好引用、找不找得到。
  • 這兩件事共用同一份內容資產,但計分板不同。舊的那套指標量不到新的那一半,而新的那一半正在變大。

人類流量當然還是重要的,廣告、名單、生意都在那一側。但「人來之前」的那一整段,現在是機器在跑;跑不通,人就永遠不會出現在漏斗末端。

實測:一週七萬次,誰來得最勤

回到我自家站群 2026 年 8 月 13 日到 19 日的紀錄,依三層拆開:

類別 七天請求 日均 佔比
訓練層 AI Crawler 30,996 4,428 44%
索引層 Search Engine 19,798 2,828 28%
索引層 AI Search 12,032 1,719 17%
即時取用層 AI Assistant 7,087 1,012 10%

訓練層是最大的一塊,佔了將近一半。這代表在我的站上,AI 公司「囤教材」的動作比「找答案」的動作多得多。

單隻機器人的排行更值得看。來我網站最勤的不是 Googlebot,是 Meta 的訓練爬蟲 Meta-ExternalAgent,日均 2,735 次,超過 Googlebot 的 1,875 次。ChatGPT-User 日均 950 次,跟 BingBot 同一個量級。

有三個結構性的觀察:

  • 訓練層是批次行為,單日從 1,093 到 8,769 都有。開採船來一趟搬一批,不是天天來,所以要看週或月的累積量,別被單日的高低嚇到或高興。
  • 即時取用層每天穩定在 950 到 1,260 之間,完全不隨訓練層波動。這代表每天都有穩定數量的真人提問打到我的內容,穩定本身就是訊號。
  • 覆蓋廣度差很多。七天之內不重複計算,訓練層掃過 2,439 個文章網址、AI 搜尋 1,269 個、傳統搜尋 885 個、即時取用層 268 個。全站 1,058 篇文章,等於一週內約有四分之一被 AI 實際拿去組過答案。

最後那個數字是我做完整份分析最意外的一項。四分之一這個比例,比我原本以為的高很多。

AI 眼中的老喬報,是一座台灣財富數據庫

把即時取用層讀最多的文章列出來,畫面非常清楚:

排名 文章主題 七天被 AI 讀取
1 台灣家庭財富深度報告 306
2 家庭財富十階梯 259
3 中國財富調查整理 232
4 台灣財富數據總覽 214
5 人均資產十分位 211
6 存款中位數調查 187
7 超高資產客群報告解讀 126
8 創業開戶銀行推薦 104
9 財富報告總對照 92
10 小紅書專業號認證 61

前九名有八篇是財富系列,第二梯隊是小紅書系列與應援文化名詞解釋。這些文章的共同點只有一個:有別人沒有的結構化數字,而且是整理過、算過、標明出處的官方統計。

AI 組答案時最缺的就是可引用的數據。誰把數據整理得最好查,AI 就一直回來拿誰的。

反過來看「沒被讀到的」也有資訊。大量長尾文章一週內 AI 一次都沒讀過,原因可能有三種:主題本來就沒人問、有人問但你不在地圖上、在地圖上但不被選用。單看抓取紀錄分不出是哪一種,得拿搜尋曝光資料交叉比對才拆得開。這是我接下來要做的事。

圖片也在被開採

這是最容易被忽略的一塊。我的圖片網域一週被抓 12,890 次,其中 8,533 次來自訓練層。拆開看誰在吃、吃什麼:

機器人 七天請求 抓了幾張不同的圖 行為解讀
Meta-ExternalAgent 6,228 3,349 廣掃全庫,幾乎把整座圖庫搬了一遍
Bytespider(字節) 2,004 249 重複抓特定圖,集中在文章首圖
BingBot 1,521 1,020 圖片索引
PerplexityBot 340 322 AI 搜尋索引也收圖

從路徑看,被吃的大宗是三類:文章首圖、資料圖表截圖,以及實拍照與品牌識別素材。也就是說,模型不只吃你的文字論述,連你做的圖表、拍的現場照都在進教材。

那圖片該怎麼優化,才能讓被吃走的圖回頭累積你的可見度?我目前的做法有四條:

  1. 圖旁一定要有文字錨。模型理解圖片主要靠周邊文字,所以圖表的結論一定要同時用文字寫在圖的前後段落。圖給人看,字給機器讀,兩者說同一件事。
  2. alt 與檔名要有語意。像「截圖-2024-10-22」這種檔名對機器是純雜訊;alt 寫成「2026 年台灣家庭財富十階梯門檻表」,才把這張圖和主題綁在一起。
  3. 圖上要有落款。圖被吃進語料之後,圖上的品牌標記是唯一跟著圖走的來源資訊。這不是美觀問題,是出處問題。
  4. 圖片網址要穩定。網址每換一次,過去累積的抓取紀錄就歸零。

那到底該看什麼指標

把三層對應到四個指標,我現在是這樣看的:

  • 主指標是即時取用層的文章頁讀取量與被讀篇數。它是即時的,而且與需求同步。
  • 資產指標是訓練層的累積抓取量。看週或月的趨勢,別看單日;效果滯後數月且不可證,所以當作「資產被吃走的規模」看,不當成效看。
  • 健康度指標是索引層的覆蓋率與回訪頻率。沒被索引,後面全免談;回訪頻率下降是最早的警訊。
  • GA 的 AI 來源流量只當下限驗證。人類沒過來,不代表內容沒被用,永遠不要拿它否定策略成效。

還有一個很多人會問的問題:那傳統排名還重要嗎?

重要。Googlebot 依然是搜尋排名的地基,而且 AI 搜尋在挑候選頁面時也大量參考既有的搜尋訊號。AI 化不是放掉排名,是在同一份內容資產上多開了兩條戰線。

至於要不要把抓最兇的 Meta、字節擋掉,我的選擇是不擋。在零點擊的現實下,進語料等於長期的 AI 曝光資產。要擋之前先想清楚你擋掉的是什麼。

一句話總結

網路是一片汪洋,你的網站是一座島。過去你要讓人找到這座島,現在你得先讓機器願意一直回來開採它。

指標要換,但要換的不是全部——是多出來的那一半。

資料來源

這篇的分類與定義不是我自己歸納的,全部出自各家官方文件。整理在這裡,你要自己查證或延伸閱讀都方便。

一、各家官方的機器人說明

來源 提供什麼
Cloudflare AI Crawl Control 機器人清單 四分類的正本,以及各家機器人的身分字串與偵測代碼
OpenAI Bots 說明 GPTBot、OAI-SearchBot、ChatGPT-User 三隻的官方定義
Anthropic 爬蟲說明 ClaudeBot、Claude-User、Claude-SearchBot 三隻的官方定義
Perplexity Bots 說明 PerplexityBot 與 Perplexity-User 的定義,以及「不用於訓練模型」的原文

這四份文件是全文最重要的依據。特別是三家對「使用者觸發型」機器人的描述結構完全一致,這也是我敢說 AI 助理不是人類、而是伺服器代替人類讀取的根據。OpenAI 的舊網址 platform.openai.com/docs/bots 現在會轉到上表那個新網址,兩個都可以用。

二、產業研究與指標定義

來源 提供什麼
Imperva 2025 Bad Bot Report 連續第 12 年的年度調查,2024 年自動化流量佔全網 51%、十年來首度超過人類
Cloudflare:crawl-to-refer ratio 爬取回饋比的定義正本,以及各家平台的實測值與量測限制
Cloudflare:依用途拆解 AI 爬蟲流量 依訓練、搜尋、即時取用與產業別拆解的跨產業對照

Cloudflare 那篇談爬取回饋比的文章值得整篇讀完,因為它自己就講了這個指標的量測限制——Claude 的原生應用程式送出的連結不帶 referer 標頭,所以分母會被系統性低估,比值因此偏高。我在前面那張表對 Anthropic 標的但書就是出自這裡。

三、本文自有數據

文中所有以「本站」開頭的數字,來源是我自己網站的 Cloudflare zone 層 HTTP 請求紀錄,涵蓋 2026 年 8 月 13 日至 19 日共七天、站群 16 個網域,每日自動入庫;人類流量的部分來自 GA4。

有三個限制要一併說清楚:

  • Cloudflare 免費方案的原始請求資料只保留 7 天,所以這類分析必須每天自動抓,斷掉超過一週就永久補不回來。
  • 這份資料有採樣機制,數字適合當趨勢讀,不適合拿去做精確對帳。
  • 機器與人類那兩個數字來自不同系統與不同時間窗,只做量級比較。

本文關鍵字:AI 爬蟲、AI bot、ChatGPT-User、GPTBot、爬取回饋比、crawl-to-refer、零點擊、AI SEO、生成式引擎最佳化、網站流量分析