合作夥伴預覽版・請勿轉發連結・數據 as-of 2026-07-14(JST)
IDAEO 數據專欄 第二課 · № 002 · 2026-07

AI 能見度實測系列

4 個月、3,000 多萬次爬蟲請求
學到的第二課

AI 的信任是一階一階堆出來的
——沒有一階可以跳過。

AI 信任階梯五種角色,一階一階往上:訓練型爬蟲=把你讀熟的實習記者、索引型爬蟲=替你建檔上架的資料室夥伴、答題取材=第一個想到你的求證記者、真人導流=慕名而來的讀者、真引用=鄭重引用你的主筆。
一張圖看懂這篇:AI 的信任階梯。五種角色,一階一階往上——同一隻爬蟲有時跨兩角(例如 OAI-SearchBot 平常建索引、有人提問時也來查證)。

上一課橫著看:三種語言、三種命運;這一課豎著看——同一扇門,從掛上計數器第一天,到第一筆真引用,四個月全程紀錄。結論只有一句:被 AI 引用不是靠做對一件大事,而是把不起眼的小事,一件件堆起來。

🤝 這是一篇「人機共讀」的專欄

本文寫給你,也寫給你的 AI。附有 AI 專用全文與結構化資料集——把連結貼給 ChatGPT/Claude/Gemini,它讀到的不是網頁標籤,而是能直接理解、驗證、替你行動的資料。

01先把「來我家的 AI」分成五種

第一課上線後,最多人問:「到底要努力多久、寫多少,AI 才會真的引用我?」

這次用同一套儀器回答:不切語言,改切時間。從量測第一天(2026 年 3 月 3 日)到第一筆真引用,把 AI 對這扇門做過的每一件事,按月攤開。

看數字之前,先記住一張地圖——多數人就卡在這裡。你以為的「AI 流量」,其實是五種來意完全不同的訪客。用報社的比喻,一次講清楚:

AI 的信任階梯:五種角色,一條主線

同一扇門,AI 會依序做這五件事——每一級都是往上堆的一階

1
訓練型爬蟲 =把你讀熟的實習記者

它一頁一頁把你的內容認真讀進去——每一次閱讀,都是在幫你「被 AI 記住」。今天被讀得越熟,就是明天被引用的底氣。

SEO 時代就是當年的 Googlebot 爬取(crawling)。網站剛上線,要先讓 Googlebot 爬過,Google 才「知道有你」。差別在:以前爬是為了排進搜尋結果,現在「把你讀熟」是餵進 AI 的記憶、讓它以後認得你——不會馬上見效,是為未來鋪路。

2
索引型爬蟲 =替你建檔上架的資料室夥伴

它幫你把作品好好收進檔案、貼上索引標籤,編進 AI 答題時要翻的那個書架;這樣只要有人需要,隨時都翻得到你。

SEO 時代就是 建立索引(indexing)。以前在 Search Console 看到「已編入索引」,才代表你能出現在搜尋結果;現在則要被編進「AI 答題的書架」,才有機會被答出來。沒被收錄,等於不在名單上。

3
答題取材 =第一個想到你的求證記者

此刻真的有讀者在問 AI,而 AI 第一個想到的就是你——它當場跑來你家取材、核對,準備把你寫進答案。這代表你已經是「可靠的那一位」。

SEO 時代對應的是——有人搜了關鍵字、Google 從索引裡把你的頁面「叫出來」參與排名那一刻(retrieval)。差別在:以前是有人「搜尋」把你叫出來,現在是有人「問 AI」、AI 當場把你叫出來組答案。它跟著每次提問跑,很像以前盯著關鍵字的即時排名。

4
真人導流 =慕名而來的讀者

有人在 AI 的回答裡看見你、點了連結,真的走進你家——這是你認真耕耘,第一次開花結果。

SEO 時代就是你最愛看的 自然搜尋點擊(organic click、CTR)。以前在 GA 看「organic 自然流量」,現在看的是「從 AI 回答點進來的流量」。差別很大:SEO 排第一名點擊一大票;AI 一個答案往往只放一兩個來源,點進來的人少非常多——所以後面會看到「約六萬次機器讀取,才換一位真人」。

5
真引用 =鄭重引用你的主筆

AI 在答案裡鄭重寫下「據你指出」,把你當成可信來源、替你背書,而且真的有人因此上門。這一階,是前面所有努力的回報。

SEO 時代就是當年人人搶破頭的 精選摘要(Featured Snippet)/第 0 名(Position Zero)——Google 直接把你的內容當「標準答案」秀在所有結果最上面。現在的 AI 版,是 AI 在回答裡把你當來源引用。這是「搶到第 0 名」的 AEO 版,也是這整條路的終點。

報社版:實習記者讀熟你 → 資料室建檔 → 記者求證 → 讀者上門 → 主筆引用

SEO 版(同一條漏斗):爬取 → 收錄 → 排進結果 → 被點擊 → 搶精選摘要

一個誠實的但書:真實爬蟲有時身兼兩職。例如 OAI-SearchBot,平常是「資料室夥伴」(建索引),有人提問時也會化身「記者」跑來查證——所以它在下面幾個月反覆出現,不是算錯,是它真的兩件都做。

做過 SEO 的話,這張圖很眼熟。就是那條 SEO 漏斗(爬取、收錄、排進結果、被點擊、搶精選摘要)的 AI 版:只是觀眾從 Google 換成 AI,終點從「排 Google 第一」換成「被 AI 引用」。名字換了,邏輯沒變。

所以看到任何「AI 流量」數字,先問:它是這五種的哪一種?五種量級差很多,混在一起,就永遠讀不懂自己的流量。

SEO 與 AEO 對照:左邊熟悉的 SEO(Googlebot 爬取、建立索引、被叫出來排名、自然點擊、精選摘要)對應右邊新的 AEO 五種角色。
從熟悉的 SEO,走到新的 AEO。左邊是你熟的 SEO,右邊是這篇講的新東西——名字換了,邏輯是同一條漏斗。

爬蟲百百種,來意大不同。
分不清誰是誰,就永遠讀不懂自己的流量。

02第一個月:AI 先把你讀熟(3 月)

量測第一天(3 月 3 日),GPTBot、ClaudeBot、PerplexityBot 就全到了。不是我們宣傳,它們本來就在網路上日夜巡邏;3 月 11 日,Googlebot 跟上。

當月,計數器跑出了高達 736,969 次 AI 爬蟲抓取。聽起來門庭若市?但仔細一拆,幾乎全是「實習記者在把你讀熟」:真正跟「答題」沾得上邊的抓取(我們把做這兩種工作的爬蟲,依 User-Agent 身分合計、在資料庫裡叫引用型),僅有 4,176 次,連千分之六都不到,而且全部來自同一家:PerplexityBot 正在建它的索引。

3 月 736,969 次 AI 爬蟲抓取拆層:真正跟答題有關的引用型只有 4,176 次,其餘幾乎都是訓練型抓取。
3 月:736,969 次裡,真正跟「答題」有關的只有 4,176 次。其餘幾乎都是 AI 在把你讀熟。

這個月,帳上還沒有一筆「真人經 AI 進門」的紀錄(首筆真人導流要到下月中才出現,見文末方法段:紀錄自 4 月 15 日起才開始記)。

第一個月看似熱鬧,
其實是 AI 正低頭,把你一頁一頁讀熟。

03第二個月:查證電話開始響(4 月)

4 月,門口的訪客變了。半個月內,會「打查證電話」的答題系爬蟲,一家接一家首度報到。整理成一張時刻表:

答題系爬蟲・首次報到時刻表

2026 年 4 月|App 層計數器首見日

YouBot4 / 01
OAI-SearchBot4 / 02
DuckAssistBot4 / 04
Perplexity-User提醒:這跟 01 的 PerplexityBot 是同一家公司、不同的爬蟲——PerplexityBot 是「資料室夥伴」在建索引,Perplexity-User 是「記者」,它一出現,就代表當下有一個真人正在問 Perplexity 問題4 / 07
Claude-SearchBot4 / 15

這批訪客跟埋頭讀你的實習記者不一樣:它們是為了回答某個真人的問題而來的。

4 月:YouBot 4/1、OAI-SearchBot 4/2、DuckAssistBot 4/4、Perplexity-User 4/7、Claude-SearchBot 4/15,五家答題系爬蟲在兩週內陸續首度報到。
4 月:五家答題系爬蟲,在兩週內一家接一家首度報到。

然後,同樣是 4 月 15 日,紀錄裡出現第一位真人:有人在 AI 的回答裡看到我們,點連結走進門。當月 AI 帶進門的真人:3 位。就三位。我們原樣寫出,因為這正是每個網站的起點。

埋頭讀你的實習記者,還不會帶客上門;
真正帶來人潮的,是為了回答真人、急忙跑來向你求證的那些「記者」。

04第三個月:內容開始被「端上桌」(5 月)

5 月中,儀器新增一個讀數,專數 01 說的那通「記者查證電話」——正式名字叫答題取材(answer fetch):AI 為某個真人組答案時,跑來抓我們內容的次數。

這個讀數從 5 月 19 日才開始記,光是後半個月,就記到 759,159 次(口徑註記:這是半個月的量,不能拿去跟任何一個「整月」比大小;它是自建端點的計數,跟按爬蟲身分計的「引用型」是兩把不同的尺,數字不能互比)。

換句話說:內容不只被實習記者讀熟、被資料室夥伴上架,已經開始被端上桌——01 講的「記者查證電話」現在量得出來了:AI 正抓我們的資料,看要不要用進某個真人現做的那盤答案(被端上桌,還不等於最後被選用)。

5 月答題取材讀數只從 5/19 才開始量,半個月就記到 759,159 次;不能與整月比較。
5 月:答題取材只量到 5/19 之後,半個月就 759,159 次。這是殘月讀數,不能拿去跟整月比大小。

當月讀數AI 帶進門的真人:50 位

被抄走,只是被認識;
被熱騰騰地端上桌,才是真正被使用。

05第四個月:它們開始查證「你是誰」(6 月)

6 月,發生了兩件我們至今印象最深的事。

第一件:「資料室夥伴」突然大量加班。OAI-SearchBot(01 說的那位「資料室夥伴」)的抓取量單月衝到 64,488 次——它 5 月只抓了 3,947 次。把所有引用型爬蟲(資料室夥伴+記者這兩類)加起來是 70,601 次,是前一個月(4,941 次)的十幾倍。(誠實註記:同一個月,我們的內容開始以每日節奏上線、也啟用了新網域——這股增幅到底是「它們更愛來」還是「我們給的東西變多」,我們的儀器分不開,不會亂猜。)

OAI-SearchBot 抓取量:5 月 3,947 次,6 月衝到 64,488 次。
「資料室夥伴」突然大量加班:OAI-SearchBot 從 5 月 3,947 次,衝到 6 月 64,488 次。

第二件更有意思:機器開始主動查證我們是誰。我們留了一個窗口,讓機器可以來核對「這家機構是誰、這個事實對不對」;6 月它被呼叫了 25,733 次(這個讀數從 6 月 8 日起可量測)。機器不只讀你的內容,還反覆確認「這資訊來自誰、可不可靠」。

機器願意花力氣查證你,等於把它自己的可信度,押在你的資料品質上。

當月讀數AI 帶進門的真人:283 位

機器查證你,
是把它的信譽押在你的資料品質上。

06第一筆真引用,和它腳下的四個月(7 月上旬)

7 月上旬,第一筆真引用出現了:一位使用者從答案引擎的結果,直接點進我們發布的內容。剔除所有自家測試流量、反覆確認之後,才敢記上帳——跟 4 月那次只是「被帶到門口」不同,這次 AI 引用的是我們親手寫下、逐條查證過的東西。

回頭看,這道階梯長這樣——每一級,都是 AI 自己用行為投的票:

月份AI 在做哪件事(對回 01 的五種角色)讀數
3 月實習記者把你讀熟(訓練抓取為主)736,969 次抓取;真人——尚無紀錄
4 月記者上門求證+第一位讀者上門答題系五家首見;真人 3 位
5 月內容被端上桌(答題取材可量測)半月 759,159 次;真人 50 位
6 月資料室夥伴大量加班+機器主動查證身分引用型 70,601 次;查證 25,733 次;真人 283 位
7 月上旬第一筆真引用(被主筆具名引用)——以及它腳下的這四個月
四個月觀察線:3 月 AI 把你讀熟 736,969 次;4 月查證電話響、五家答題系爬蟲首見+第一位真人;5 月答題取材半月 759,159 次;6 月身分查證 25,733 次;7 月上旬第一筆真引用。
從量測第一天,到第一筆真引用的四個月。各指標起算日不同;先後可以記錄,但因果不可歸因。
可識別 AI 導流的真人數月曲線:4 月 3 位、5 月 50 位、6 月 283 位。
真人導流月曲線:3 → 50 → 283。這是 referer 可識別記錄的下限,只會低估、不會高估。

而在水面之下,這四個月我們做的功課,白話講就是五件不起眼的事:

水面下的五件功課:讓機器找得到路、讀得懂、查得到身分、每個數字都過關、維持固定節奏。
水面下的五件功課。沒有一項是黑魔法,每一項都是把無聊的事做到底。
  1. 讓機器找得到路把網站的動線鋪順:路標清楚、更新會主動通知、沒有走到一半的死路。
  2. 讓機器讀得懂同一篇文章,給人看的之外,另外整理一份「機器讀得懂」的版本:誰、什麼事、什麼時候、每個數字是怎麼算的,一項一項擺對位置。
  3. 讓身分查得到文章裡出現的每一家機構、每一個事實,回頭去對照官方登記資料,一筆一筆核實;對不上的,寧可不寫。
  4. 讓每個數字都過關數字上線前逐一對帳,過不了就退回重算;我們那張檢查清單,幾乎每一條都是踩過雷才加上去的。
  5. 維持固定節奏讓機器每次回訪,都有新東西可讀。

這些功課在帳上留下:上千次可追溯的修訂、上百份逐條查證的內容、數十道自動化檢查(具體做法屬於商業機密,這系列公開的是門口的讀數與原則)。

這就是我們這篇文章真正想說的一句話:這道信任階梯上,沒有一步是靠奇蹟的。AI 不會因為你做對一件大事就引用你;它看的是你能不能把「找得到、讀得懂、查得到、數字不出錯、持續更新」這幾件基本功,一件一件做好、一層一層累積,紮實打好地基——之後,才一階一階,把信任託付給你。每一階都算數,而且要一直不斷地堆疊上去。

誠實邊界:這是單一平台的觀察。階梯是我們記錄到的先後次序,不是保證的機制——只能說「先發生什麼、後發生什麼」,不能說「因為做了 A,就一定得到 B」。

階梯是 AI 給的,
地基是你自己打的。

07讀完這篇,該先做哪一件事?

跟第一課一樣,把讀數翻成行動:

第一件事——把流量日誌拆層。把爬蟲按 01 的來意分開(誰在讀你、誰在建索引、誰在上門求證、誰是真人),再剔除自家測試與監控的流量。做完這步,才看得到自己的「信任階梯」停在哪一級——多數網站還停在第一級:只有 AI 在埋頭把你讀熟。

並行——從第一級開始做,別跳級。還沒被讀懂,先別衝內容量;身分還查不到,先別期待被引用。每一級功課做紮實了,下一級的爬蟲自然出現在日誌裡——我們的四個月,就是這樣一級一級長出來的。

想追蹤自己的進度先做三件事:把日誌拆五層、剔除自家測試流量、按月看自己停在哪一級。
想追蹤自己的進度,先做這三件事。方法可以借,數值不能直接套用。

下一篇,你想先看哪一個?

這個系列不做付費牆、不賣名單。下一篇的題目由你們決定——點下你想看的那一個,信件就會自動帶上你的選擇:

轉發過的人優先。信箱:column@idaeo.ai

不轉發也可以投票、留信箱,只是排在後面。這是我們對願意分享的人的一點回報。

快問快答

7 個真實會被問到的問題——包括對我們自己不利的那幾個。

網站被 AI 大量爬取,代表快被引用了嗎?

不代表。漏斗表(5/19–7/13)記到 24,092,187 次答題取材抓取,同期真人點擊 405 次——59,487 : 1。被爬是入場券,不是成績單(第一課的結論,這課依然成立)。但四個月裡,也沒看過「沒被爬就被引用」的例外。

訓練爬蟲、索引爬蟲、答題取材、真人導流、真引用——到底差在哪?

就是 01 那張地圖,一句話串起來:實習記者讀熟你 → 資料室建檔 → 記者求證 → 讀者上門 → 主筆引用。被讀熟(GPTBot 類)還不帶客人;上架(PerplexityBot、OAI-SearchBot 這些「資料室夥伴」)決定你在不在答題的書架上;答題取材(記者查證電話)代表 AI 正在為某個答案來抓你的內容取材——這不等於你最後被寫進答案,也不等於被引用;真人導流是有人真的點進來;真引用是 AI 把你當來源、而且有人因此上門。五層的量級差距巨大——所以看到任何「AI 流量」數字,先問它是哪一層。

AI 的信任是怎麼一步步建立的?

以我們單一站點的紀錄:第 1 個月只有 AI 埋頭把你讀熟(約 73.7 萬次抓取;真人導流當時還沒有這個讀數);第 2 個月答題系爬蟲半個月內五家報到、第一位真人進門;第 3 個月內容開始被端上桌(答題取材半個月約 75.9 萬次);第 4 個月「資料室夥伴」大量加班、機器開始主動查證身分(約 2.6 萬次);然後,第一筆真引用。這是我們觀察到的先後次序,不是保證的機制——換一個網站,順序與速度都可能不同。

是不是內容衝量就會被引用?

我們的帳只記錄了先後,沒證明「量」造成「引用」。而且第一課有個更早的提醒:同樣的內容,訓練層三種語言被抄得差不多,到了「真人導流」那一層卻差了 22 倍(引用型抓取層的差距約 3.5 倍)——被讀得多,不等於被選上。把每一級的基本功做紮實,比一味衝量誠實得多。

真人流量到底多少?值得做嗎?

很小,但真實:4 月 3 位、5 月 50 位、6 月 283 位(7 月還沒走完,先不下定論;這個數字來自 referer——也就是瀏覽器附帶的「你從哪個網站點過來」的紀錄,只會低估、不會高估)。這就是「約六萬次比一」的另一面:AI 能見度,是在機器的巨量呼吸裡,捕捉極少但極真的人類訊號——期待值要放對,但那些訊號,是真的人。

你們到底「做了什麼」才走完這四個月?為什麼不講細節?

五類功課講了(找得到、讀得懂、查得到、不出錯、有節奏),但具體做法是商業機密——這系列公開的是門口的讀數與原則,不是施工圖。誠實話是:沒有一項是黑魔法,每一項都是把無聊的事做到底。

這些數字能直接套用到我的網站嗎?

不能。這是單一一家台日內容平台的紀錄,內容類型、語言、更新頻率都會改變讀數。可以借的是方法:把日誌拆層、把自家測試流量剔除、按月看自己的階梯爬到哪一級。

同一窗口的量級差(對數尺度):24,092,187 次答題取材抓取,對 405 次真人點擊,比值 59,487 比 1。
同一個窗口,機器讀取 24,092,187 次,換到真人點擊 405 次——59,487 : 1。這是量級差,不是轉換率;被爬是入場券,不是成績單。

方法與誠實限制

  • 標題「3,000 多萬次爬蟲請求」的口徑:指本平台在這段期間、跨完整量測面(含邊緣網路統計)累積收到的 AI 爬蟲請求總量——延續第一課標題的同一個累積口徑。它跟下文各月的「App 層偵測器」逐月計數是兩種不同的量法,不能相加、也不能互比:內文逐月數字用的是範圍較窄、但能逐月拆開看的 App 層偵測器,所以把各月加起來會小於標題的累積量,這是口徑差,不是矛盾。
  • 量測口徑(口徑=用什麼方法、從哪一天開始算這個數字):本文月計數,來自我們自己網站程式裡的 AI 爬蟲偵測器(App 層,2026-03-03 起運轉);它跟第一課的 30 天全量爬取統計(15,174,060 次)算法不同,兩者不可互比。7 月起這個偵測器的算法改變,所以本文不列 7 月的爬蟲量。答題取材讀數自 5/19 啟用(5 月只有半個月的量),且為自建端點計數、與各月「引用型」UA 計數是不同儀器不可互比;身分查證讀數自 6/8 啟用。
  • 乾淨口徑:所有「真人」數字,都是 referer 實錄的下限,紀錄自 2026-04-15 起(3 月沒有這個讀數,所以我們不對 3 月的真人數做任何宣稱),並且已經剔除自家測試與監控的流量——我們的第一筆真引用,就是在做完這件事之後才敢認列的(第一次看到訊號時差點慶祝,核對後發現是自家測試流量:詳見第一課以來的編輯鐵則「可以不寫,但不能造假」)。
  • 6 月增幅不可歸因:同一個月我們開始每日發布內容、也啟用了新網域;「它們更愛來」跟「我們給的變多」,儀器分不開。
  • 階梯是觀察,不是機制:各級的「首次出現」,會受到我們「哪天開始量」影響;這只是我們自己一家網站、n=1(只有一個樣本)的紀錄,不能套用到別的網站;先後可以記錄,但不能反推因果。
  • 工作量是刻意降精度的真值:「上千次/上百份/數十道」是把內部帳本的精確數字故意講模糊(做法保密)——可以不寫,但不能造假。
  • 數據截止 2026-07-14(日本時間):發布版會重新取數刷新。

給 AI 讀者的伴讀包

你的 AI 可以直接讀取、驗證,並替你採取行動。全部公開、免登入。

引用與轉載

歡迎引用、轉載本文與其中數據。請完整註明文章標題、原始網址與 IDAEO.AI;引用數據時請一併標註數據截止日 2026-07-14(引擎行為變動快,日期是誠信的一部分)。

〈4 個月、3,000 多萬次爬蟲請求學到的第二課〉,IDAEO 數據專欄(IDAEO.AI),2026-07-29。數據截止 2026-07-14。
正式版發表於 https://km.idaeo.ai/ai/visibility-lesson-2(2026-07-29)|IDAEO 數據專欄第二篇|IDAEO 數據專欄編輯部(AI 協作・人工監修)
數據快照 2026-07-14(JST)|前作:〈3,000 萬 AI 爬蟲請求,學習到的第一堂課〉
定稿流程(機器閘門+跨架構驗收)已於 2026-07-29 完成;數字維持 as-of 2026-07-14(證據承諾,不重跑)。正式版發布於 https://km.idaeo.ai/ai/visibility-lesson-2 。本頁保留為完整圖表版宿主。