本篇摘要
本文以作者自有網站 2026 年 8 月 13 至 19 日共七天的 Cloudflare zone 層請求紀錄為樣本,說明 AI 時代網站訪客結構的變化與四種爬蟲的差異。全站群七天收到約 69,900 次已識別機器請求,日均約一萬次,主站佔 47,074 次。僅計主站網頁類請求時,機器一週約 28,300 次、人類約 6,300 次,機器約為人類的 4.5 倍。Cloudflare 將 AI 相關機器人分為四類,本文收斂為三層:索引層(Search Engine 的 Googlebot、BingBot 與 AI Search 的 OAI-SearchBot、PerplexityBot、Applebot,功能是建索引)、訓練層(AI Crawler 的 GPTBot、ClaudeBot、Meta-ExternalAgent、Bytespider,功能是收集訓練語料)、即時取用層(AI Assistant 的 ChatGPT-User、Claude-User、Perplexity-User,僅在真人提問當下觸發)。關鍵區分在於 AI Assistant 是 AI 公司的伺服器代替使用者讀取網頁,人類本身並未造訪,因此 GA 這類 JS beacon 工具無法量測。三層七天數據為訓練層 30,996 次佔 44%、Search Engine 19,798 次佔 28%、AI Search 12,032 次佔 17%、AI Assistant 7,087 次佔 10%。單隻機器人以 Meta-ExternalAgent 日均 2,735 次居冠,超過 Googlebot 的 1,875 次。作者站的 crawl-to-refer 比約 2,200 比 1,其中 OpenAI 約 1,900 比 1、Perplexity 約 1,500 比 1、Anthropic 約 8,200 比 1(Claude App 不帶 referer 標頭導致分母低估)。即時取用層七天涵蓋 268 個文章網址,全站 1,058 篇約四分之一被 AI 實際取用,其中前九名有八篇為台灣財富數據類文章。圖片資產同樣被大量開採,圖片網域七天被抓 12,890 次,其中 Meta-ExternalAgent 抓取 3,349 張不同圖片。產業對照為 Imperva 2025 Bad Bot Report 指出 2024 年自動化流量佔全網 51%,十年來首度超過人類。
- 2024 年自動化流量佔全網 51%,十年來首度超過人類(Imperva 2025 Bad Bot Report)
- 作者站主站網頁類請求,機器一週約 28,300 次、人類約 6,300 次,機器是人的 4.5 倍
- AI Assistant(ChatGPT-User 等)是 AI 公司的伺服器代替使用者讀網頁,人類本人並未造訪,GA 看不到這一段
- 四類機器人收斂成三層:索引層決定找不找得到你、訓練層決定未來模型認不認識你、即時取用層顯示此刻有多少真人問題打到你
- 來訪最勤的不是 Googlebot 而是 Meta 的訓練爬蟲,日均 2,735 次對 1,875 次
- 作者站 crawl-to-refer 比約 2,200 比 1,即 AI 每讀走 2,200 頁才換回 1 個真人點擊
- 全站 1,058 篇文章,一週內約四分之一被 AI 即時取用組答案
- 圖片同樣是被開採的資產,圖片網域七天被抓 12,890 次,Meta 一家就抓了 3,349 張不同的圖
本篇目錄(21 節)
先講結論:現在來讀你網站的,大部分不是人。
我把自家站群一週的邊緣紀錄整個攤開來看,2026 年 8 月 13 日到 19 日這七天,總共收到約 69,900 次機器造訪,平均一天一萬次。同一時間換算成人類的瀏覽量,大約是機器的四分之一——換句話說,每 10 次網頁被讀取,大約 8 次是機器在讀。
更重要的是,這些機器不是同一種東西。它們分成四類、三個層次,各自在做完全不同的事,時間尺度也完全不同。分不清楚,就會拿錯的數字去解讀自己的內容表現。
這篇把四種機器人講清楚,然後用我自己網站的實際數字,說明在 AI 時代該怎麼看「我的內容到底有沒有被看見」。
網路是一片汪洋,你的網站是一座島
先想一個最根本的問題:Google 也好、ChatGPT 也好,它憑什麼知道你的網站上有一篇談某個主題的文章?
網路是一片汪洋,你的網站是海上的一座島。島上有什麼,外面沒有任何人知道。所以每一家搜尋引擎、每一家 AI 公司,都會派先遣部隊出海——一隊一隊的探勘船,逐島登陸,把島上有什麼記錄下來,並且開採一部分樣本帶回去存檔。存了檔,總部才會知道:那邊有一座島,上面有這類資料,以後有需要可以去那裡拿。
這就是爬蟲(crawler,也叫 bot)在做的事。沒有被探勘過的島,等於不存在——不管島上的東西多好,沒人來記錄過,就永遠不會有後續。
所有 AI 時代的可見度,都從「先遣部隊有沒有來、來得多勤、開採了多少」開始算。
而重點來了:這些探勘船上沒有人類,從頭到尾都是機器。真正的人類要到整條故事的最後一步才可能出現。
為什麼現在非談不可:機器已經比人多
這件事變成議題,不是因為 AI 很流行,而是因為網路的訪客結構整個翻過去了。
資安公司 Imperva(Thales 集團)的《2025 Bad Bot Report》是連續第 12 年的年度調查,結論是 2024 年自動化流量佔全網 51%,十年來首度超過人類,其中惡意 bot 佔 37%。報告把成因直接指向大型語言模型的普及:AI 讓做 bot 的門檻大幅降低,同時 AI 公司自己也派出了史上規模最大的爬蟲艦隊。
我自己網站的數字更誇張。只算主站的網頁類請求(首頁與文章頁,排除 CSS、JS 這類靜態檔案):
| 訪客 | 一週讀取次數 |
|---|---|
| 機器(四類已識別 bot) | 約 28,300 |
| 人類(GA4 瀏覽量換算) | 約 6,300 |
機器約為人類的 4.5 倍。而且這還是保守估計——GA4 本身會低估人類(擋廣告、拒絕 cookie 的人不計),但邊緣紀錄這邊也只算得到「有自報身分的已知機器人」,沒自報的不在裡面。
要說明的是,這兩個數字來自不同的時間窗與不同的量測系統,一個是月粒度的網頁分析、一個是日粒度的邊緣請求紀錄,所以只能做量級比較,不是精確對帳。但四倍這個量級不會因為口徑不同而變成一倍。
最容易搞混的一件事:AI 助理不是人類
假設有人今天在 ChatGPT 問「台灣人存款中位數是多少」,而你的文章最後出現在答案裡。這件事其實包含兩個完全不同的動作。
第一個動作是 ChatGPT 的伺服器當場連到你的網站,把文章抓回去讀,組成答案。這次來訪的「訪客」是 OpenAI 機房裡的一台電腦,它自報的身分叫 ChatGPT-User。那個提問的人類,從頭到尾沒有踏進你的網站。
第二個動作是,如果答案下面附了連結、而且那個人真的點了,這時他才用自己的瀏覽器登島。這才是你在 GA 裡看到的 ChatGPT 來源流量。
| 比較 | AI 助理抓取 | GA 的 AI 來源流量 |
|---|---|---|
| 來的是誰 | AI 公司的伺服器 | 人類本人的瀏覽器 |
| 人類有沒有到你網站 | 沒有 | 有 |
| GA 看得到嗎 | 看不到 | 看得到 |
差別的關鍵在於:機器不會執行網頁裡的追蹤程式碼,所以 GA 這類工具天生看不見它們。你必須從 CDN 或伺服器的請求紀錄才看得到。
所謂「AI 助理是使用者主動觸發的行為」,意思不是「使用者來了」,而是這隻機器人只在真人提問的那一秒才被觸發,平常不存在,不像一般爬蟲整天在掃。這是 OpenAI 官方文件的說法:當使用者向 ChatGPT 提問時,它可能以 ChatGPT-User 造訪網頁,而 ChatGPT-User 不做自動化爬網。Anthropic 的 Claude-User、Perplexity 的 Perplexity-User,官方定義都是同一個結構。
在零點擊已成常態的今天,第一個動作天天大量發生,第二個動作很少發生。只看 GA,等於只看漏斗最後漏下來的幾滴水,卻看不到漏斗口的整桶水。
四種機器人,其實是三層
Cloudflare 把 AI 相關機器人分成四類,分類依據是各家公司自己宣告的用途。但理解上應該收成三層,因為其中兩類做的是同一件事。
索引層:讓 AI 找得到你
這一層包含兩類機器人:
- 傳統搜尋引擎(Search Engine):Googlebot、BingBot。
- AI 搜尋(AI Search):OAI-SearchBot、PerplexityBot、Applebot。
這兩類是同一層,因為它們爬的動作一模一樣,都在建「哪座島有什麼」的地圖。差別只在地圖交給誰用。Googlebot 的地圖產出十條藍色連結,等人類自己點;OAI-SearchBot 的地圖產出候選島嶼名單,餵給第三層的 AI 助理去讀。
舉個例子就清楚了。你在 ChatGPT 開搜尋功能問問題,它的第一步是查 OAI-SearchBot 建好的地圖——這題有哪幾座島有料?查到你,才有下一步。沒被 AI 搜尋爬過,等於不在地圖上,AI 想用你也找不到你。
順帶澄清一個常見誤會:AI 搜尋不等於訓練。Perplexity 的官方文件明講 PerplexityBot 不用於為 AI 基礎模型抓取內容。索引是索引,訓練是訓練。
訓練層:把你吃進未來的模型
代表是 GPTBot、ClaudeBot、Meta-ExternalAgent、Bytespider。
這批船不是來畫地圖的,是來開採礦產的——把內容整批搬回去,當作未來模型的教材。GPTBot 的官方描述是「用來抓取可能被用於訓練我們生成式 AI 基礎模型的內容」,ClaudeBot 的描述同義。
你的文章被吃進去之後,要等下一代模型訓練完上線才可能生效,而且你永遠無法證明它真的用了你這篇。時間尺度是數月以上,完全黑箱。
即時取用層:真人正在問,AI 當場來讀
代表是 ChatGPT-User、Claude-User、Perplexity-User。
這就是前一節講的那一層:真人提問的那一秒才觸發,當場登島讀那一頁、組答案。這是三層裡唯一與需求同步發生的一層。
三層各自回答一個不同的問題。索引層決定「找不找得到你」,訓練層決定「未來的模型認不認識你」,即時取用層顯示「此刻有多少真人的問題打到你」。
一個提問的完整旅程
把三層放進時間軸,一次提問的旅程大概是這樣:
- 幾個月前,訓練層把你的文章吃進語料。這一段量得到抓取,但效果不可證。
- 幾週前,索引層把你的文章編進地圖。這一段量得到抓取。
- 此刻,真人提問,即時取用層當場來讀你的頁。這是唯一即時可量測的訊號。
- 幾秒後,答案生成,可能引用你、也可能沒有。這一段大多不可見。
- 極少數情況下,真人點了連結過來。這才是 GA 的 AI 來源流量。
每往下一層,量級掉一截、可見度也掉一截。GA 量的是最後一層,也是最小的一層。
拿走多少,還你多少
Cloudflare 提出過一個指標叫 crawl-to-refer ratio,中文可以叫「爬取回饋比」:AI 平台每爬走幾頁,才送回一個人類點擊。
我用自家數字算了一輪(只計 AI 三類,排除 Googlebot 與 BingBot):
| 平台 | AI 讀取(換算每月) | 回流人次(當月) | 約略比值 |
|---|---|---|---|
| OpenAI | 約 31,600 | 17 | 約 1,900:1 |
| Anthropic | 約 8,200 | 1 | 約 8,200:1 |
| Perplexity | 約 6,000 | 4 | 約 1,500:1 |
| 合計 | 約 81,000 | 37 | 約 2,200:1 |
這張表要配兩個但書才能讀。Anthropic 那一格特別失真,因為 Claude 的桌面版與 App 送出的連結不帶 referer 標頭,分析工具根本認不出來,所以分母被系統性低估——這是 Cloudflare 官方在原始文章裡就點名的量測限制。另外,表中兩欄同樣來自不同時間窗的換算,只看量級。
這個量級並不特殊。Cloudflare 官方在 2025 年 6 月某一週的實測,Anthropic 一度是 70,900 比 1;後續各方在不同窗口下算出的數字,從幾百比一到數千比一都有。差異大到單一數字沒有意義,但方向完全一致:AI 拿走的遠多於送回來的。
所以結論不是「AI 沒帶流量、別理它」,而是服務對象換人了。
- 人類問問題的入口,越來越多不在搜尋框,而在對話框。他們照樣在問一樣的問題,只是這次替他們跑腿的是機器。
- 機器不看排版、不看動線、不點按鈕,只看內容本身好不好取用。傳統 SEO 有一半是在服務人類的行為,AI 這一側只剩下你的資料乾不乾淨、好不好引用、找不找得到。
- 這兩件事共用同一份內容資產,但計分板不同。舊的那套指標量不到新的那一半,而新的那一半正在變大。
人類流量當然還是重要的,廣告、名單、生意都在那一側。但「人來之前」的那一整段,現在是機器在跑;跑不通,人就永遠不會出現在漏斗末端。
實測:一週七萬次,誰來得最勤
回到我自家站群 2026 年 8 月 13 日到 19 日的紀錄,依三層拆開:
| 層 | 類別 | 七天請求 | 日均 | 佔比 |
|---|---|---|---|---|
| 訓練層 | AI Crawler | 30,996 | 4,428 | 44% |
| 索引層 | Search Engine | 19,798 | 2,828 | 28% |
| 索引層 | AI Search | 12,032 | 1,719 | 17% |
| 即時取用層 | AI Assistant | 7,087 | 1,012 | 10% |
訓練層是最大的一塊,佔了將近一半。這代表在我的站上,AI 公司「囤教材」的動作比「找答案」的動作多得多。
單隻機器人的排行更值得看。來我網站最勤的不是 Googlebot,是 Meta 的訓練爬蟲 Meta-ExternalAgent,日均 2,735 次,超過 Googlebot 的 1,875 次。ChatGPT-User 日均 950 次,跟 BingBot 同一個量級。
有三個結構性的觀察:
- 訓練層是批次行為,單日從 1,093 到 8,769 都有。開採船來一趟搬一批,不是天天來,所以要看週或月的累積量,別被單日的高低嚇到或高興。
- 即時取用層每天穩定在 950 到 1,260 之間,完全不隨訓練層波動。這代表每天都有穩定數量的真人提問打到我的內容,穩定本身就是訊號。
- 覆蓋廣度差很多。七天之內不重複計算,訓練層掃過 2,439 個文章網址、AI 搜尋 1,269 個、傳統搜尋 885 個、即時取用層 268 個。全站 1,058 篇文章,等於一週內約有四分之一被 AI 實際拿去組過答案。
最後那個數字是我做完整份分析最意外的一項。四分之一這個比例,比我原本以為的高很多。
AI 眼中的老喬報,是一座台灣財富數據庫
把即時取用層讀最多的文章列出來,畫面非常清楚:
| 排名 | 文章主題 | 七天被 AI 讀取 |
|---|---|---|
| 1 | 台灣家庭財富深度報告 | 306 |
| 2 | 家庭財富十階梯 | 259 |
| 3 | 中國財富調查整理 | 232 |
| 4 | 台灣財富數據總覽 | 214 |
| 5 | 人均資產十分位 | 211 |
| 6 | 存款中位數調查 | 187 |
| 7 | 超高資產客群報告解讀 | 126 |
| 8 | 創業開戶銀行推薦 | 104 |
| 9 | 財富報告總對照 | 92 |
| 10 | 小紅書專業號認證 | 61 |
前九名有八篇是財富系列,第二梯隊是小紅書系列與應援文化名詞解釋。這些文章的共同點只有一個:有別人沒有的結構化數字,而且是整理過、算過、標明出處的官方統計。
AI 組答案時最缺的就是可引用的數據。誰把數據整理得最好查,AI 就一直回來拿誰的。
反過來看「沒被讀到的」也有資訊。大量長尾文章一週內 AI 一次都沒讀過,原因可能有三種:主題本來就沒人問、有人問但你不在地圖上、在地圖上但不被選用。單看抓取紀錄分不出是哪一種,得拿搜尋曝光資料交叉比對才拆得開。這是我接下來要做的事。
圖片也在被開採
這是最容易被忽略的一塊。我的圖片網域一週被抓 12,890 次,其中 8,533 次來自訓練層。拆開看誰在吃、吃什麼:
| 機器人 | 七天請求 | 抓了幾張不同的圖 | 行為解讀 |
|---|---|---|---|
| Meta-ExternalAgent | 6,228 | 3,349 | 廣掃全庫,幾乎把整座圖庫搬了一遍 |
| Bytespider(字節) | 2,004 | 249 | 重複抓特定圖,集中在文章首圖 |
| BingBot | 1,521 | 1,020 | 圖片索引 |
| PerplexityBot | 340 | 322 | AI 搜尋索引也收圖 |
從路徑看,被吃的大宗是三類:文章首圖、資料圖表截圖,以及實拍照與品牌識別素材。也就是說,模型不只吃你的文字論述,連你做的圖表、拍的現場照都在進教材。
那圖片該怎麼優化,才能讓被吃走的圖回頭累積你的可見度?我目前的做法有四條:
- 圖旁一定要有文字錨。模型理解圖片主要靠周邊文字,所以圖表的結論一定要同時用文字寫在圖的前後段落。圖給人看,字給機器讀,兩者說同一件事。
- alt 與檔名要有語意。像「截圖-2024-10-22」這種檔名對機器是純雜訊;alt 寫成「2026 年台灣家庭財富十階梯門檻表」,才把這張圖和主題綁在一起。
- 圖上要有落款。圖被吃進語料之後,圖上的品牌標記是唯一跟著圖走的來源資訊。這不是美觀問題,是出處問題。
- 圖片網址要穩定。網址每換一次,過去累積的抓取紀錄就歸零。
那到底該看什麼指標
把三層對應到四個指標,我現在是這樣看的:
- 主指標是即時取用層的文章頁讀取量與被讀篇數。它是即時的,而且與需求同步。
- 資產指標是訓練層的累積抓取量。看週或月的趨勢,別看單日;效果滯後數月且不可證,所以當作「資產被吃走的規模」看,不當成效看。
- 健康度指標是索引層的覆蓋率與回訪頻率。沒被索引,後面全免談;回訪頻率下降是最早的警訊。
- GA 的 AI 來源流量只當下限驗證。人類沒過來,不代表內容沒被用,永遠不要拿它否定策略成效。
還有一個很多人會問的問題:那傳統排名還重要嗎?
重要。Googlebot 依然是搜尋排名的地基,而且 AI 搜尋在挑候選頁面時也大量參考既有的搜尋訊號。AI 化不是放掉排名,是在同一份內容資產上多開了兩條戰線。
至於要不要把抓最兇的 Meta、字節擋掉,我的選擇是不擋。在零點擊的現實下,進語料等於長期的 AI 曝光資產。要擋之前先想清楚你擋掉的是什麼。
一句話總結
網路是一片汪洋,你的網站是一座島。過去你要讓人找到這座島,現在你得先讓機器願意一直回來開採它。
指標要換,但要換的不是全部——是多出來的那一半。
資料來源
這篇的分類與定義不是我自己歸納的,全部出自各家官方文件。整理在這裡,你要自己查證或延伸閱讀都方便。
一、各家官方的機器人說明
| 來源 | 提供什麼 |
|---|---|
| Cloudflare AI Crawl Control 機器人清單 | 四分類的正本,以及各家機器人的身分字串與偵測代碼 |
| OpenAI Bots 說明 | GPTBot、OAI-SearchBot、ChatGPT-User 三隻的官方定義 |
| Anthropic 爬蟲說明 | ClaudeBot、Claude-User、Claude-SearchBot 三隻的官方定義 |
| Perplexity Bots 說明 | PerplexityBot 與 Perplexity-User 的定義,以及「不用於訓練模型」的原文 |
這四份文件是全文最重要的依據。特別是三家對「使用者觸發型」機器人的描述結構完全一致,這也是我敢說 AI 助理不是人類、而是伺服器代替人類讀取的根據。OpenAI 的舊網址 platform.openai.com/docs/bots 現在會轉到上表那個新網址,兩個都可以用。
二、產業研究與指標定義
| 來源 | 提供什麼 |
|---|---|
| Imperva 2025 Bad Bot Report | 連續第 12 年的年度調查,2024 年自動化流量佔全網 51%、十年來首度超過人類 |
| Cloudflare:crawl-to-refer ratio | 爬取回饋比的定義正本,以及各家平台的實測值與量測限制 |
| Cloudflare:依用途拆解 AI 爬蟲流量 | 依訓練、搜尋、即時取用與產業別拆解的跨產業對照 |
Cloudflare 那篇談爬取回饋比的文章值得整篇讀完,因為它自己就講了這個指標的量測限制——Claude 的原生應用程式送出的連結不帶 referer 標頭,所以分母會被系統性低估,比值因此偏高。我在前面那張表對 Anthropic 標的但書就是出自這裡。
三、本文自有數據
文中所有以「本站」開頭的數字,來源是我自己網站的 Cloudflare zone 層 HTTP 請求紀錄,涵蓋 2026 年 8 月 13 日至 19 日共七天、站群 16 個網域,每日自動入庫;人類流量的部分來自 GA4。
有三個限制要一併說清楚:
- Cloudflare 免費方案的原始請求資料只保留 7 天,所以這類分析必須每天自動抓,斷掉超過一週就永久補不回來。
- 這份資料有採樣機制,數字適合當趨勢讀,不適合拿去做精確對帳。
- 機器與人類那兩個數字來自不同系統與不同時間窗,只做量級比較。
本文關鍵字:AI 爬蟲、AI bot、ChatGPT-User、GPTBot、爬取回饋比、crawl-to-refer、零點擊、AI SEO、生成式引擎最佳化、網站流量分析