---
title: "誰在讀你的網站？AI 時代的四種爬蟲，用我自家一週七萬次紀錄拆給你看"
url: https://joelin.cc/p/9639
source: https://joelin.cc/p/9639
id: 9639
slug: ai-crawler-four-types-explained
pubDate: 2026-08-20
date_modified: 2026-08-20
updatedDate: 2026-08-20
schema_type: BlogPosting
description: "現在來讀你網站的大部分不是人。我把自家站群一週的邊緣紀錄攤開，用 69,900 次機器造訪的實測數字，講清楚索引層、訓練層、即時取用層三種 AI 爬蟲的差別，以及該換掉哪些指標。"
ai_summary: "本文以作者自有網站 2026 年 8 月 13 至 19 日共七天的 Cloudflare zone 層請求紀錄為樣本，說明 AI 時代網站訪客結構的變化與四種爬蟲的差異。全站群七天收到約 69,900 次已識別機器請求，日均約一萬次，主站佔 47,074 次。僅計主站網頁類請求時，機器一週約 28,300 次、人類約 6,300 次，機器約為人類的 4.5 倍。Cloudflare 將 AI 相關機器人分為四類，本文收斂為三層：索引層（Search Engine 的 Googlebot、BingBot 與 AI Search 的 OAI-SearchBot、PerplexityBot、Applebot，功能是建索引）、訓練層（AI Crawler 的 GPTBot、ClaudeBot、Meta-ExternalAgent、Bytespider，功能是收集訓練語料）、即時取用層（AI Assistant 的 ChatGPT-User、Claude-User、Perplexity-User，僅在真人提問當下觸發）。關鍵區分在於 AI Assistant 是 AI 公司的伺服器代替使用者讀取網頁，人類本身並未造訪，因此 GA 這類 JS beacon 工具無法量測。三層七天數據為訓練層 30,996 次佔 44%、Search Engine 19,798 次佔 28%、AI Search 12,032 次佔 17%、AI Assistant 7,087 次佔 10%。單隻機器人以 Meta-ExternalAgent 日均 2,735 次居冠，超過 Googlebot 的 1,875 次。作者站的 crawl-to-refer 比約 2,200 比 1，其中 OpenAI 約 1,900 比 1、Perplexity 約 1,500 比 1、Anthropic 約 8,200 比 1（Claude App 不帶 referer 標頭導致分母低估）。即時取用層七天涵蓋 268 個文章網址，全站 1,058 篇約四分之一被 AI 實際取用，其中前九名有八篇為台灣財富數據類文章。圖片資產同樣被大量開採，圖片網域七天被抓 12,890 次，其中 Meta-ExternalAgent 抓取 3,349 張不同圖片。產業對照為 Imperva 2025 Bad Bot Report 指出 2024 年自動化流量佔全網 51%，十年來首度超過人類。"
key_facts: [2024 年自動化流量佔全網 51%，十年來首度超過人類（Imperva 2025 Bad Bot Report）, 作者站主站網頁類請求，機器一週約 28,300 次、人類約 6,300 次，機器是人的 4.5 倍, AI Assistant（ChatGPT-User 等）是 AI 公司的伺服器代替使用者讀網頁，人類本人並未造訪，GA 看不到這一段, 四類機器人收斂成三層：索引層決定找不找得到你、訓練層決定未來模型認不認識你、即時取用層顯示此刻有多少真人問題打到你, 來訪最勤的不是 Googlebot 而是 Meta 的訓練爬蟲，日均 2,735 次對 1,875 次, 作者站 crawl-to-refer 比約 2,200 比 1，即 AI 每讀走 2,200 頁才換回 1 個真人點擊, 全站 1,058 篇文章，一週內約四分之一被 AI 即時取用組答案, 圖片同樣是被開採的資產，圖片網域七天被抓 12,890 次，Meta 一家就抓了 3,349 張不同的圖]
categories: [商業/科技前沿參考, 數位行銷]
tags: [AI, SEO, 數位行銷]
authorship:
  origin: written
  ai_role: assist
entity_ids:
  author: https://me.joelin.cc/#joe
  publisher: https://me.joelin.cc/#joelincc
---

# 誰在讀你的網站？AI 時代的四種爬蟲，用我自家一週七萬次紀錄拆給你看

## 摘要

本文以作者自有網站 2026 年 8 月 13 至 19 日共七天的 Cloudflare zone 層請求紀錄為樣本，說明 AI 時代網站訪客結構的變化與四種爬蟲的差異。全站群七天收到約 69,900 次已識別機器請求，日均約一萬次，主站佔 47,074 次。僅計主站網頁類請求時，機器一週約 28,300 次、人類約 6,300 次，機器約為人類的 4.5 倍。Cloudflare 將 AI 相關機器人分為四類，本文收斂為三層：索引層（Search Engine 的 Googlebot、BingBot 與 AI Search 的 OAI-SearchBot、PerplexityBot、Applebot，功能是建索引）、訓練層（AI Crawler 的 GPTBot、ClaudeBot、Meta-ExternalAgent、Bytespider，功能是收集訓練語料）、即時取用層（AI Assistant 的 ChatGPT-User、Claude-User、Perplexity-User，僅在真人提問當下觸發）。關鍵區分在於 AI Assistant 是 AI 公司的伺服器代替使用者讀取網頁，人類本身並未造訪，因此 GA 這類 JS beacon 工具無法量測。三層七天數據為訓練層 30,996 次佔 44%、Search Engine 19,798 次佔 28%、AI Search 12,032 次佔 17%、AI Assistant 7,087 次佔 10%。單隻機器人以 Meta-ExternalAgent 日均 2,735 次居冠，超過 Googlebot 的 1,875 次。作者站的 crawl-to-refer 比約 2,200 比 1，其中 OpenAI 約 1,900 比 1、Perplexity 約 1,500 比 1、Anthropic 約 8,200 比 1（Claude App 不帶 referer 標頭導致分母低估）。即時取用層七天涵蓋 268 個文章網址，全站 1,058 篇約四分之一被 AI 實際取用，其中前九名有八篇為台灣財富數據類文章。圖片資產同樣被大量開採，圖片網域七天被抓 12,890 次，其中 Meta-ExternalAgent 抓取 3,349 張不同圖片。產業對照為 Imperva 2025 Bad Bot Report 指出 2024 年自動化流量佔全網 51%，十年來首度超過人類。

### 重點

- 2024 年自動化流量佔全網 51%，十年來首度超過人類（Imperva 2025 Bad Bot Report）
- 作者站主站網頁類請求，機器一週約 28,300 次、人類約 6,300 次，機器是人的 4.5 倍
- AI Assistant（ChatGPT-User 等）是 AI 公司的伺服器代替使用者讀網頁，人類本人並未造訪，GA 看不到這一段
- 四類機器人收斂成三層：索引層決定找不找得到你、訓練層決定未來模型認不認識你、即時取用層顯示此刻有多少真人問題打到你
- 來訪最勤的不是 Googlebot 而是 Meta 的訓練爬蟲，日均 2,735 次對 1,875 次
- 作者站 crawl-to-refer 比約 2,200 比 1，即 AI 每讀走 2,200 頁才換回 1 個真人點擊
- 全站 1,058 篇文章，一週內約四分之一被 AI 即時取用組答案
- 圖片同樣是被開採的資產，圖片網域七天被抓 12,890 次，Meta 一家就抓了 3,349 張不同的圖

先講結論：現在來讀你網站的，大部分不是人。

我把自家站群一週的邊緣紀錄整個攤開來看，2026 年 8 月 13 日到 19 日這七天，總共收到約 69,900 次機器造訪，平均一天一萬次。同一時間換算成人類的瀏覽量，大約是機器的四分之一——換句話說，每 10 次網頁被讀取，大約 8 次是機器在讀。

更重要的是，這些機器不是同一種東西。它們分成四類、三個層次，各自在做完全不同的事，時間尺度也完全不同。分不清楚，就會拿錯的數字去解讀自己的內容表現。

這篇把四種機器人講清楚，然後用我自己網站的實際數字，說明在 AI 時代該怎麼看「我的內容到底有沒有被看見」。

![誰在讀你的網站？一週 69,900 次造訪，機器是人的四倍，分成索引層、訓練層、即時取用層三種 AI 爬蟲](https://image.joelin.cc/cdn-cgi/imagedelivery/0xu8EsaSar9n3zUKY5d7xw/joelin/2026-08/ai-crawler-hero/hero)

## 網路是一片汪洋，你的網站是一座島

先想一個最根本的問題：Google 也好、ChatGPT 也好，它憑什麼知道你的網站上有一篇談某個主題的文章？

網路是一片汪洋，你的網站是海上的一座島。島上有什麼，外面沒有任何人知道。所以每一家搜尋引擎、每一家 AI 公司，都會派先遣部隊出海——一隊一隊的探勘船，逐島登陸，把島上有什麼記錄下來，並且開採一部分樣本帶回去存檔。存了檔，總部才會知道：那邊有一座島，上面有這類資料，以後有需要可以去那裡拿。

這就是爬蟲（crawler，也叫 bot）在做的事。沒有被探勘過的島，等於不存在——不管島上的東西多好，沒人來記錄過，就永遠不會有後續。

所有 AI 時代的可見度，都從「先遣部隊有沒有來、來得多勤、開採了多少」開始算。

而重點來了：這些探勘船上沒有人類，從頭到尾都是機器。真正的人類要到整條故事的最後一步才可能出現。

## 為什麼現在非談不可：機器已經比人多

這件事變成議題，不是因為 AI 很流行，而是因為網路的訪客結構整個翻過去了。

資安公司 Imperva（Thales 集團）的《2025 Bad Bot Report》是連續第 12 年的年度調查，結論是 2024 年自動化流量佔全網 51%，十年來首度超過人類，其中惡意 bot 佔 37%。報告把成因直接指向大型語言模型的普及：AI 讓做 bot 的門檻大幅降低，同時 AI 公司自己也派出了史上規模最大的爬蟲艦隊。

我自己網站的數字更誇張。只算主站的網頁類請求（首頁與文章頁，排除 CSS、JS 這類靜態檔案）：

| 訪客 | 一週讀取次數 |
|---|---|
| 機器（四類已識別 bot） | 約 28,300 |
| 人類（GA4 瀏覽量換算） | 約 6,300 |

機器約為人類的 4.5 倍。而且這還是保守估計——GA4 本身會低估人類（擋廣告、拒絕 cookie 的人不計），但邊緣紀錄這邊也只算得到「有自報身分的已知機器人」，沒自報的不在裡面。

要說明的是，這兩個數字來自不同的時間窗與不同的量測系統，一個是月粒度的網頁分析、一個是日粒度的邊緣請求紀錄，所以只能做量級比較，不是精確對帳。但四倍這個量級不會因為口徑不同而變成一倍。

## 最容易搞混的一件事：AI 助理不是人類

假設有人今天在 ChatGPT 問「台灣人存款中位數是多少」，而你的文章最後出現在答案裡。這件事其實包含兩個完全不同的動作。

第一個動作是 ChatGPT 的伺服器當場連到你的網站，把文章抓回去讀，組成答案。這次來訪的「訪客」是 OpenAI 機房裡的一台電腦，它自報的身分叫 ChatGPT-User。那個提問的人類，從頭到尾沒有踏進你的網站。

第二個動作是，如果答案下面附了連結、而且那個人真的點了，這時他才用自己的瀏覽器登島。這才是你在 GA 裡看到的 ChatGPT 來源流量。

| 比較 | AI 助理抓取 | GA 的 AI 來源流量 |
|---|---|---|
| 來的是誰 | AI 公司的伺服器 | 人類本人的瀏覽器 |
| 人類有沒有到你網站 | 沒有 | 有 |
| GA 看得到嗎 | 看不到 | 看得到 |

差別的關鍵在於：機器不會執行網頁裡的追蹤程式碼，所以 GA 這類工具天生看不見它們。你必須從 CDN 或伺服器的請求紀錄才看得到。

所謂「AI 助理是使用者主動觸發的行為」，意思不是「使用者來了」，而是這隻機器人只在真人提問的那一秒才被觸發，平常不存在，不像一般爬蟲整天在掃。這是 OpenAI 官方文件的說法：當使用者向 ChatGPT 提問時，它可能以 ChatGPT-User 造訪網頁，而 ChatGPT-User 不做自動化爬網。Anthropic 的 Claude-User、Perplexity 的 Perplexity-User，官方定義都是同一個結構。

在零點擊已成常態的今天，第一個動作天天大量發生，第二個動作很少發生。只看 GA，等於只看漏斗最後漏下來的幾滴水，卻看不到漏斗口的整桶水。

## 四種機器人，其實是三層

Cloudflare 把 AI 相關機器人分成四類，分類依據是各家公司自己宣告的用途。但理解上應該收成三層，因為其中兩類做的是同一件事。

![機器人其實分三層：索引層先畫地圖讓 AI 找得到你、訓練層開採內容餵給未來的模型、即時取用層是真人正在問 AI 當場來讀](https://image.joelin.cc/cdn-cgi/imagedelivery/0xu8EsaSar9n3zUKY5d7xw/joelin/2026-08/ai-bot-three-layers/hero)

### 索引層：讓 AI 找得到你

這一層包含兩類機器人：

- 傳統搜尋引擎（Search Engine）：Googlebot、BingBot。
- AI 搜尋（AI Search）：OAI-SearchBot、PerplexityBot、Applebot。

這兩類是同一層，因為它們爬的動作一模一樣，都在建「哪座島有什麼」的地圖。差別只在地圖交給誰用。Googlebot 的地圖產出十條藍色連結，等人類自己點；OAI-SearchBot 的地圖產出候選島嶼名單，餵給第三層的 AI 助理去讀。

舉個例子就清楚了。你在 ChatGPT 開搜尋功能問問題，它的第一步是查 OAI-SearchBot 建好的地圖——這題有哪幾座島有料？查到你，才有下一步。沒被 AI 搜尋爬過，等於不在地圖上，AI 想用你也找不到你。

順帶澄清一個常見誤會：AI 搜尋不等於訓練。Perplexity 的官方文件明講 PerplexityBot 不用於為 AI 基礎模型抓取內容。索引是索引，訓練是訓練。

### 訓練層：把你吃進未來的模型

代表是 GPTBot、ClaudeBot、Meta-ExternalAgent、Bytespider。

這批船不是來畫地圖的，是來開採礦產的——把內容整批搬回去，當作未來模型的教材。GPTBot 的官方描述是「用來抓取可能被用於訓練我們生成式 AI 基礎模型的內容」，ClaudeBot 的描述同義。

你的文章被吃進去之後，要等下一代模型訓練完上線才可能生效，而且你永遠無法證明它真的用了你這篇。時間尺度是數月以上，完全黑箱。

### 即時取用層：真人正在問，AI 當場來讀

代表是 ChatGPT-User、Claude-User、Perplexity-User。

這就是前一節講的那一層：真人提問的那一秒才觸發，當場登島讀那一頁、組答案。這是三層裡唯一與需求同步發生的一層。

三層各自回答一個不同的問題。索引層決定「找不找得到你」，訓練層決定「未來的模型認不認識你」，即時取用層顯示「此刻有多少真人的問題打到你」。

## 一個提問的完整旅程

把三層放進時間軸，一次提問的旅程大概是這樣：

1. 幾個月前，訓練層把你的文章吃進語料。這一段量得到抓取，但效果不可證。
2. 幾週前，索引層把你的文章編進地圖。這一段量得到抓取。
3. 此刻，真人提問，即時取用層當場來讀你的頁。這是唯一即時可量測的訊號。
4. 幾秒後，答案生成，可能引用你、也可能沒有。這一段大多不可見。
5. 極少數情況下，真人點了連結過來。這才是 GA 的 AI 來源流量。

每往下一層，量級掉一截、可見度也掉一截。GA 量的是最後一層，也是最小的一層。

## 拿走多少，還你多少

Cloudflare 提出過一個指標叫 crawl-to-refer ratio，中文可以叫「爬取回饋比」：AI 平台每爬走幾頁，才送回一個人類點擊。

我用自家數字算了一輪（只計 AI 三類，排除 Googlebot 與 BingBot）：

| 平台 | AI 讀取（換算每月） | 回流人次（當月） | 約略比值 |
|---|---|---|---|
| OpenAI | 約 31,600 | 17 | 約 1,900：1 |
| Anthropic | 約 8,200 | 1 | 約 8,200：1 |
| Perplexity | 約 6,000 | 4 | 約 1,500：1 |
| 合計 | 約 81,000 | 37 | 約 2,200：1 |

這張表要配兩個但書才能讀。Anthropic 那一格特別失真，因為 Claude 的桌面版與 App 送出的連結不帶 referer 標頭，分析工具根本認不出來，所以分母被系統性低估——這是 Cloudflare 官方在原始文章裡就點名的量測限制。另外，表中兩欄同樣來自不同時間窗的換算，只看量級。

![AI 拿走多少還你多少：本站實測每 2,200 頁被 AI 讀走，才換回 1 個真人點進來，零點擊不是意外而是新的常態](https://image.joelin.cc/cdn-cgi/imagedelivery/0xu8EsaSar9n3zUKY5d7xw/joelin/2026-08/crawl-to-refer-2200/hero)

這個量級並不特殊。Cloudflare 官方在 2025 年 6 月某一週的實測，Anthropic 一度是 70,900 比 1；後續各方在不同窗口下算出的數字，從幾百比一到數千比一都有。差異大到單一數字沒有意義，但方向完全一致：AI 拿走的遠多於送回來的。

所以結論不是「AI 沒帶流量、別理它」，而是服務對象換人了。

- 人類問問題的入口，越來越多不在搜尋框，而在對話框。他們照樣在問一樣的問題，只是這次替他們跑腿的是機器。
- 機器不看排版、不看動線、不點按鈕，只看內容本身好不好取用。傳統 SEO 有一半是在服務人類的行為，AI 這一側只剩下你的資料乾不乾淨、好不好引用、找不找得到。
- 這兩件事共用同一份內容資產，但計分板不同。舊的那套指標量不到新的那一半，而新的那一半正在變大。

人類流量當然還是重要的，廣告、名單、生意都在那一側。但「人來之前」的那一整段，現在是機器在跑；跑不通，人就永遠不會出現在漏斗末端。

## 實測：一週七萬次，誰來得最勤

回到我自家站群 2026 年 8 月 13 日到 19 日的紀錄，依三層拆開：

| 層 | 類別 | 七天請求 | 日均 | 佔比 |
|---|---|---|---|---|
| 訓練層 | AI Crawler | 30,996 | 4,428 | 44% |
| 索引層 | Search Engine | 19,798 | 2,828 | 28% |
| 索引層 | AI Search | 12,032 | 1,719 | 17% |
| 即時取用層 | AI Assistant | 7,087 | 1,012 | 10% |

訓練層是最大的一塊，佔了將近一半。這代表在我的站上，AI 公司「囤教材」的動作比「找答案」的動作多得多。

單隻機器人的排行更值得看。來我網站最勤的不是 Googlebot，是 Meta 的訓練爬蟲 Meta-ExternalAgent，日均 2,735 次，超過 Googlebot 的 1,875 次。ChatGPT-User 日均 950 次，跟 BingBot 同一個量級。

有三個結構性的觀察：

- 訓練層是批次行為，單日從 1,093 到 8,769 都有。開採船來一趟搬一批，不是天天來，所以要看週或月的累積量，別被單日的高低嚇到或高興。
- 即時取用層每天穩定在 950 到 1,260 之間，完全不隨訓練層波動。這代表每天都有穩定數量的真人提問打到我的內容，穩定本身就是訊號。
- 覆蓋廣度差很多。七天之內不重複計算，訓練層掃過 2,439 個文章網址、AI 搜尋 1,269 個、傳統搜尋 885 個、即時取用層 268 個。全站 1,058 篇文章，等於一週內約有四分之一被 AI 實際拿去組過答案。

最後那個數字是我做完整份分析最意外的一項。四分之一這個比例，比我原本以為的高很多。

## AI 眼中的老喬報，是一座台灣財富數據庫

把即時取用層讀最多的文章列出來，畫面非常清楚：

| 排名 | 文章主題 | 七天被 AI 讀取 |
|---|---|---|
| 1 | 台灣家庭財富深度報告 | 306 |
| 2 | 家庭財富十階梯 | 259 |
| 3 | 中國財富調查整理 | 232 |
| 4 | 台灣財富數據總覽 | 214 |
| 5 | 人均資產十分位 | 211 |
| 6 | 存款中位數調查 | 187 |
| 7 | 超高資產客群報告解讀 | 126 |
| 8 | 創業開戶銀行推薦 | 104 |
| 9 | 財富報告總對照 | 92 |
| 10 | 小紅書專業號認證 | 61 |

前九名有八篇是財富系列，第二梯隊是小紅書系列與應援文化名詞解釋。這些文章的共同點只有一個：有別人沒有的結構化數字，而且是整理過、算過、標明出處的官方統計。

AI 組答案時最缺的就是可引用的數據。誰把數據整理得最好查，AI 就一直回來拿誰的。

反過來看「沒被讀到的」也有資訊。大量長尾文章一週內 AI 一次都沒讀過，原因可能有三種：主題本來就沒人問、有人問但你不在地圖上、在地圖上但不被選用。單看抓取紀錄分不出是哪一種，得拿搜尋曝光資料交叉比對才拆得開。這是我接下來要做的事。

## 圖片也在被開採

這是最容易被忽略的一塊。我的圖片網域一週被抓 12,890 次，其中 8,533 次來自訓練層。拆開看誰在吃、吃什麼：

| 機器人 | 七天請求 | 抓了幾張不同的圖 | 行為解讀 |
|---|---|---|---|
| Meta-ExternalAgent | 6,228 | 3,349 | 廣掃全庫，幾乎把整座圖庫搬了一遍 |
| Bytespider（字節） | 2,004 | 249 | 重複抓特定圖，集中在文章首圖 |
| BingBot | 1,521 | 1,020 | 圖片索引 |
| PerplexityBot | 340 | 322 | AI 搜尋索引也收圖 |

從路徑看，被吃的大宗是三類：文章首圖、資料圖表截圖，以及實拍照與品牌識別素材。也就是說，模型不只吃你的文字論述，連你做的圖表、拍的現場照都在進教材。

那圖片該怎麼優化，才能讓被吃走的圖回頭累積你的可見度？我目前的做法有四條：

1. 圖旁一定要有文字錨。模型理解圖片主要靠周邊文字，所以圖表的結論一定要同時用文字寫在圖的前後段落。圖給人看，字給機器讀，兩者說同一件事。
2. alt 與檔名要有語意。像「截圖-2024-10-22」這種檔名對機器是純雜訊；alt 寫成「2026 年台灣家庭財富十階梯門檻表」，才把這張圖和主題綁在一起。
3. 圖上要有落款。圖被吃進語料之後，圖上的品牌標記是唯一跟著圖走的來源資訊。這不是美觀問題，是出處問題。
4. 圖片網址要穩定。網址每換一次，過去累積的抓取紀錄就歸零。

## 那到底該看什麼指標

把三層對應到四個指標，我現在是這樣看的：

- 主指標是即時取用層的文章頁讀取量與被讀篇數。它是即時的，而且與需求同步。
- 資產指標是訓練層的累積抓取量。看週或月的趨勢，別看單日；效果滯後數月且不可證，所以當作「資產被吃走的規模」看，不當成效看。
- 健康度指標是索引層的覆蓋率與回訪頻率。沒被索引，後面全免談；回訪頻率下降是最早的警訊。
- GA 的 AI 來源流量只當下限驗證。人類沒過來，不代表內容沒被用，永遠不要拿它否定策略成效。

還有一個很多人會問的問題：那傳統排名還重要嗎？

重要。Googlebot 依然是搜尋排名的地基，而且 AI 搜尋在挑候選頁面時也大量參考既有的搜尋訊號。AI 化不是放掉排名，是在同一份內容資產上多開了兩條戰線。

至於要不要把抓最兇的 Meta、字節擋掉，我的選擇是不擋。在零點擊的現實下，進語料等於長期的 AI 曝光資產。要擋之前先想清楚你擋掉的是什麼。

## 一句話總結

網路是一片汪洋，你的網站是一座島。過去你要讓人找到這座島，現在你得先讓機器願意一直回來開採它。

指標要換，但要換的不是全部——是多出來的那一半。

## 資料來源

這篇的分類與定義不是我自己歸納的，全部出自各家官方文件。整理在這裡，你要自己查證或延伸閱讀都方便。

### 一、各家官方的機器人說明

| 來源 | 提供什麼 |
|---|---|
| [Cloudflare AI Crawl Control 機器人清單](https://developers.cloudflare.com/ai-crawl-control/reference/bots/) | 四分類的正本，以及各家機器人的身分字串與偵測代碼 |
| [OpenAI Bots 說明](https://developers.openai.com/api/docs/bots) | GPTBot、OAI-SearchBot、ChatGPT-User 三隻的官方定義 |
| [Anthropic 爬蟲說明](https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler) | ClaudeBot、Claude-User、Claude-SearchBot 三隻的官方定義 |
| [Perplexity Bots 說明](https://docs.perplexity.ai/guides/bots) | PerplexityBot 與 Perplexity-User 的定義，以及「不用於訓練模型」的原文 |

這四份文件是全文最重要的依據。特別是三家對「使用者觸發型」機器人的描述結構完全一致，這也是我敢說 AI 助理不是人類、而是伺服器代替人類讀取的根據。OpenAI 的舊網址 platform.openai.com/docs/bots 現在會轉到上表那個新網址，兩個都可以用。

### 二、產業研究與指標定義

| 來源 | 提供什麼 |
|---|---|
| [Imperva 2025 Bad Bot Report](https://www.imperva.com/resources/resource-library/reports/2025-bad-bot-report/) | 連續第 12 年的年度調查，2024 年自動化流量佔全網 51%、十年來首度超過人類 |
| [Cloudflare：crawl-to-refer ratio](https://blog.cloudflare.com/ai-search-crawl-refer-ratio-on-radar/) | 爬取回饋比的定義正本，以及各家平台的實測值與量測限制 |
| [Cloudflare：依用途拆解 AI 爬蟲流量](https://blog.cloudflare.com/ai-crawler-traffic-by-purpose-and-industry/) | 依訓練、搜尋、即時取用與產業別拆解的跨產業對照 |

Cloudflare 那篇談爬取回饋比的文章值得整篇讀完，因為它自己就講了這個指標的量測限制——Claude 的原生應用程式送出的連結不帶 referer 標頭，所以分母會被系統性低估，比值因此偏高。我在前面那張表對 Anthropic 標的但書就是出自這裡。

### 三、本文自有數據

文中所有以「本站」開頭的數字，來源是我自己網站的 Cloudflare zone 層 HTTP 請求紀錄，涵蓋 2026 年 8 月 13 日至 19 日共七天、站群 16 個網域，每日自動入庫；人類流量的部分來自 GA4。

有三個限制要一併說清楚：

- Cloudflare 免費方案的原始請求資料只保留 7 天，所以這類分析必須每天自動抓，斷掉超過一週就永久補不回來。
- 這份資料有採樣機制，數字適合當趨勢讀，不適合拿去做精確對帳。
- 機器與人類那兩個數字來自不同系統與不同時間窗，只做量級比較。

本文關鍵字：AI 爬蟲、AI bot、ChatGPT-User、GPTBot、爬取回饋比、crawl-to-refer、零點擊、AI SEO、生成式引擎最佳化、網站流量分析

## 常見問題

### AI Assistant 這類爬蟲，來訪的是人還是機器？

是機器。當有人在 ChatGPT 提問時，是 OpenAI 的伺服器連到你的網站把文章讀回去組答案，那個提問的人類從頭到尾沒有踏進你的網站。只有他後來點了答案裡的連結，才算真的造訪，那才是 GA 看得到的 AI 來源流量。所謂使用者主動觸發，指的是這隻機器人只在真人提問那一秒才被觸發，平常不存在。

### AI Search 和傳統搜尋引擎的爬蟲差在哪裡？

爬取的動作沒有差別，兩者都在建索引，差別在索引交給誰用。Googlebot 建的索引產出十條藍色連結，等人類自己點；OAI-SearchBot 建的索引產出候選頁面名單，餵給 AI 助理去讀並組成答案。另外要澄清的是，AI 搜尋不等於訓練，Perplexity 官方明確聲明 PerplexityBot 不用於為 AI 基礎模型抓取內容。

### 訓練爬蟲抓得很兇，是好事還是壞事？

在零點擊策略下算是好事，被吃進語料等於未來的模型認識你。但它是最長天期也最不可驗證的投資，效果要等下一代模型上線，而且你永遠無法證明它真的用了你的內容。所以應該當作資產累積量來看，不能當成效指標。

### crawl-to-refer 比是什麼？多少算正常？

這是 Cloudflare 提出的指標，指 AI 平台每爬走幾頁才送回一個人類點擊。作者站實測約 2,200 比 1。這個量級並不特殊，Cloudflare 官方在 2025 年 6 月某週的實測中 Anthropic 一度達 70,900 比 1，各方在不同窗口算出的數字從幾百比一到數千比一都有。單一數字沒有意義，但方向一致：AI 拿走的遠多於送回來的。

### AI 時代還需要在意傳統搜尋排名嗎？

需要。Googlebot 依然是搜尋排名的地基，而且 AI 搜尋在挑選候選頁面時也大量參考既有的搜尋訊號。AI 化不是放掉排名，而是在同一份內容資產上多開了兩條戰線，計分板要多一套，不是換一套。

### 圖片也會被 AI 拿走嗎？該怎麼優化？

會，而且量很大。作者站的圖片網域七天被抓 12,890 次，其中 8,533 次來自訓練層，Meta 一家就抓了 3,349 張不同的圖，被吃的包含文章首圖、資料圖表截圖與實拍照。優化的重點是圖旁一定要有文字錨把圖的結論用文字寫一遍、alt 與檔名要有語意、圖上要有落款標明出處、圖片網址要保持穩定。
