AI 能見度實測系列
4 個月、3,000 多萬次爬蟲請求
學到的第二課
AI 的信任是一階一階堆出來的
——沒有一階可以跳過。
上一課橫著看:三種語言、三種命運;這一課豎著看——同一扇門,從掛上計數器第一天,到第一筆真引用,四個月全程紀錄。結論只有一句:被 AI 引用不是靠做對一件大事,而是把不起眼的小事,一件件堆起來。
🤝 這是一篇「人機共讀」的專欄
本文寫給你,也寫給你的 AI。附有 AI 專用全文與結構化資料集——把連結貼給 ChatGPT/Claude/Gemini,它讀到的不是網頁標籤,而是能直接理解、驗證、替你行動的資料。
01先把「來我家的 AI」分成五種
第一課上線後,最多人問:「到底要努力多久、寫多少,AI 才會真的引用我?」
這次用同一套儀器回答:不切語言,改切時間。從量測第一天(2026 年 3 月 3 日)到第一筆真引用,把 AI 對這扇門做過的每一件事,按月攤開。
看數字之前,先記住一張地圖——多數人就卡在這裡。你以為的「AI 流量」,其實是五種來意完全不同的訪客。用報社的比喻,一次講清楚:
AI 的信任階梯:五種角色,一條主線
同一扇門,AI 會依序做這五件事——每一級都是往上堆的一階
它一頁一頁把你的內容認真讀進去——每一次閱讀,都是在幫你「被 AI 記住」。今天被讀得越熟,就是明天被引用的底氣。
SEO 時代就是當年的 Googlebot 爬取(crawling)。網站剛上線,要先讓 Googlebot 爬過,Google 才「知道有你」。差別在:以前爬是為了排進搜尋結果,現在「把你讀熟」是餵進 AI 的記憶、讓它以後認得你——不會馬上見效,是為未來鋪路。
它幫你把作品好好收進檔案、貼上索引標籤,編進 AI 答題時要翻的那個書架;這樣只要有人需要,隨時都翻得到你。
SEO 時代就是 建立索引(indexing)。以前在 Search Console 看到「已編入索引」,才代表你能出現在搜尋結果;現在則要被編進「AI 答題的書架」,才有機會被答出來。沒被收錄,等於不在名單上。
此刻真的有讀者在問 AI,而 AI 第一個想到的就是你——它當場跑來你家取材、核對,準備把你寫進答案。這代表你已經是「可靠的那一位」。
SEO 時代對應的是——有人搜了關鍵字、Google 從索引裡把你的頁面「叫出來」參與排名那一刻(retrieval)。差別在:以前是有人「搜尋」把你叫出來,現在是有人「問 AI」、AI 當場把你叫出來組答案。它跟著每次提問跑,很像以前盯著關鍵字的即時排名。
有人在 AI 的回答裡看見你、點了連結,真的走進你家——這是你認真耕耘,第一次開花結果。
SEO 時代就是你最愛看的 自然搜尋點擊(organic click、CTR)。以前在 GA 看「organic 自然流量」,現在看的是「從 AI 回答點進來的流量」。差別很大:SEO 排第一名點擊一大票;AI 一個答案往往只放一兩個來源,點進來的人少非常多——所以後面會看到「約六萬次機器讀取,才換一位真人」。
AI 在答案裡鄭重寫下「據你指出」,把你當成可信來源、替你背書,而且真的有人因此上門。這一階,是前面所有努力的回報。
SEO 時代就是當年人人搶破頭的 精選摘要(Featured Snippet)/第 0 名(Position Zero)——Google 直接把你的內容當「標準答案」秀在所有結果最上面。現在的 AI 版,是 AI 在回答裡把你當來源引用。這是「搶到第 0 名」的 AEO 版,也是這整條路的終點。
報社版:實習記者讀熟你 → 資料室建檔 → 記者求證 → 讀者上門 → 主筆引用
SEO 版(同一條漏斗):爬取 → 收錄 → 排進結果 → 被點擊 → 搶精選摘要
一個誠實的但書:真實爬蟲有時身兼兩職。例如 OAI-SearchBot,平常是「資料室夥伴」(建索引),有人提問時也會化身「記者」跑來查證——所以它在下面幾個月反覆出現,不是算錯,是它真的兩件都做。
做過 SEO 的話,這張圖很眼熟。就是那條 SEO 漏斗(爬取、收錄、排進結果、被點擊、搶精選摘要)的 AI 版:只是觀眾從 Google 換成 AI,終點從「排 Google 第一」換成「被 AI 引用」。名字換了,邏輯沒變。
所以看到任何「AI 流量」數字,先問:它是這五種的哪一種?五種量級差很多,混在一起,就永遠讀不懂自己的流量。
爬蟲百百種,來意大不同。
分不清誰是誰,就永遠讀不懂自己的流量。
02第一個月:AI 先把你讀熟(3 月)
量測第一天(3 月 3 日),GPTBot、ClaudeBot、PerplexityBot 就全到了。不是我們宣傳,它們本來就在網路上日夜巡邏;3 月 11 日,Googlebot 跟上。
當月,計數器跑出了高達 736,969 次 AI 爬蟲抓取。聽起來門庭若市?但仔細一拆,幾乎全是「實習記者在把你讀熟」:真正跟「答題」沾得上邊的抓取(我們把做這兩種工作的爬蟲,依 User-Agent 身分合計、在資料庫裡叫引用型),僅有 4,176 次,連千分之六都不到,而且全部來自同一家:PerplexityBot 正在建它的索引。
這個月,帳上還沒有一筆「真人經 AI 進門」的紀錄(首筆真人導流要到下月中才出現,見文末方法段:紀錄自 4 月 15 日起才開始記)。
第一個月看似熱鬧,
其實是 AI 正低頭,把你一頁一頁讀熟。
03第二個月:查證電話開始響(4 月)
4 月,門口的訪客變了。半個月內,會「打查證電話」的答題系爬蟲,一家接一家首度報到。整理成一張時刻表:
答題系爬蟲・首次報到時刻表
2026 年 4 月|App 層計數器首見日
這批訪客跟埋頭讀你的實習記者不一樣:它們是為了回答某個真人的問題而來的。
然後,同樣是 4 月 15 日,紀錄裡出現第一位真人:有人在 AI 的回答裡看到我們,點連結走進門。當月 AI 帶進門的真人:3 位。就三位。我們原樣寫出,因為這正是每個網站的起點。
埋頭讀你的實習記者,還不會帶客上門;
真正帶來人潮的,是為了回答真人、急忙跑來向你求證的那些「記者」。
04第三個月:內容開始被「端上桌」(5 月)
5 月中,儀器新增一個讀數,專數 01 說的那通「記者查證電話」——正式名字叫答題取材(answer fetch):AI 為某個真人組答案時,跑來抓我們內容的次數。
這個讀數從 5 月 19 日才開始記,光是後半個月,就記到 759,159 次(口徑註記:這是半個月的量,不能拿去跟任何一個「整月」比大小;它是自建端點的計數,跟按爬蟲身分計的「引用型」是兩把不同的尺,數字不能互比)。
換句話說:內容不只被實習記者讀熟、被資料室夥伴上架,已經開始被端上桌——01 講的「記者查證電話」現在量得出來了:AI 正抓我們的資料,看要不要用進某個真人現做的那盤答案(被端上桌,還不等於最後被選用)。
當月讀數AI 帶進門的真人:50 位
被抄走,只是被認識;
被熱騰騰地端上桌,才是真正被使用。
05第四個月:它們開始查證「你是誰」(6 月)
6 月,發生了兩件我們至今印象最深的事。
第一件:「資料室夥伴」突然大量加班。OAI-SearchBot(01 說的那位「資料室夥伴」)的抓取量單月衝到 64,488 次——它 5 月只抓了 3,947 次。把所有引用型爬蟲(資料室夥伴+記者這兩類)加起來是 70,601 次,是前一個月(4,941 次)的十幾倍。(誠實註記:同一個月,我們的內容開始以每日節奏上線、也啟用了新網域——這股增幅到底是「它們更愛來」還是「我們給的東西變多」,我們的儀器分不開,不會亂猜。)
第二件更有意思:機器開始主動查證我們是誰。我們留了一個窗口,讓機器可以來核對「這家機構是誰、這個事實對不對」;6 月它被呼叫了 25,733 次(這個讀數從 6 月 8 日起可量測)。機器不只讀你的內容,還反覆確認「這資訊來自誰、可不可靠」。
機器願意花力氣查證你,等於把它自己的可信度,押在你的資料品質上。
當月讀數AI 帶進門的真人:283 位
機器查證你,
是把它的信譽押在你的資料品質上。
06第一筆真引用,和它腳下的四個月(7 月上旬)
7 月上旬,第一筆真引用出現了:一位使用者從答案引擎的結果,直接點進我們發布的內容。剔除所有自家測試流量、反覆確認之後,才敢記上帳——跟 4 月那次只是「被帶到門口」不同,這次 AI 引用的是我們親手寫下、逐條查證過的東西。
回頭看,這道階梯長這樣——每一級,都是 AI 自己用行為投的票:
| 月份 | AI 在做哪件事(對回 01 的五種角色) | 讀數 |
|---|---|---|
| 3 月 | 實習記者把你讀熟(訓練抓取為主) | 736,969 次抓取;真人——尚無紀錄 |
| 4 月 | 記者上門求證+第一位讀者上門 | 答題系五家首見;真人 3 位 |
| 5 月 | 內容被端上桌(答題取材可量測) | 半月 759,159 次;真人 50 位 |
| 6 月 | 資料室夥伴大量加班+機器主動查證身分 | 引用型 70,601 次;查證 25,733 次;真人 283 位 |
| 7 月上旬 | 第一筆真引用(被主筆具名引用) | ——以及它腳下的這四個月 |
而在水面之下,這四個月我們做的功課,白話講就是五件不起眼的事:
- 讓機器找得到路把網站的動線鋪順:路標清楚、更新會主動通知、沒有走到一半的死路。
- 讓機器讀得懂同一篇文章,給人看的之外,另外整理一份「機器讀得懂」的版本:誰、什麼事、什麼時候、每個數字是怎麼算的,一項一項擺對位置。
- 讓身分查得到文章裡出現的每一家機構、每一個事實,回頭去對照官方登記資料,一筆一筆核實;對不上的,寧可不寫。
- 讓每個數字都過關數字上線前逐一對帳,過不了就退回重算;我們那張檢查清單,幾乎每一條都是踩過雷才加上去的。
- 維持固定節奏讓機器每次回訪,都有新東西可讀。
這些功課在帳上留下:上千次可追溯的修訂、上百份逐條查證的內容、數十道自動化檢查(具體做法屬於商業機密,這系列公開的是門口的讀數與原則)。
這就是我們這篇文章真正想說的一句話:這道信任階梯上,沒有一步是靠奇蹟的。AI 不會因為你做對一件大事就引用你;它看的是你能不能把「找得到、讀得懂、查得到、數字不出錯、持續更新」這幾件基本功,一件一件做好、一層一層累積,紮實打好地基——之後,才一階一階,把信任託付給你。每一階都算數,而且要一直不斷地堆疊上去。
誠實邊界:這是單一平台的觀察。階梯是我們記錄到的先後次序,不是保證的機制——只能說「先發生什麼、後發生什麼」,不能說「因為做了 A,就一定得到 B」。
階梯是 AI 給的,
地基是你自己打的。
07讀完這篇,該先做哪一件事?
跟第一課一樣,把讀數翻成行動:
第一件事——把流量日誌拆層。把爬蟲按 01 的來意分開(誰在讀你、誰在建索引、誰在上門求證、誰是真人),再剔除自家測試與監控的流量。做完這步,才看得到自己的「信任階梯」停在哪一級——多數網站還停在第一級:只有 AI 在埋頭把你讀熟。
並行——從第一級開始做,別跳級。還沒被讀懂,先別衝內容量;身分還查不到,先別期待被引用。每一級功課做紮實了,下一級的爬蟲自然出現在日誌裡——我們的四個月,就是這樣一級一級長出來的。
下一篇,你想先看哪一個?
這個系列不做付費牆、不賣名單。下一篇的題目由你們決定——點下你想看的那一個,信件就會自動帶上你的選擇:
轉發過的人優先。信箱:column@idaeo.ai
不轉發也可以投票、留信箱,只是排在後面。這是我們對願意分享的人的一點回報。
快問快答
7 個真實會被問到的問題——包括對我們自己不利的那幾個。
網站被 AI 大量爬取,代表快被引用了嗎?
不代表。漏斗表(5/19–7/13)記到 24,092,187 次答題取材抓取,同期真人點擊 405 次——59,487 : 1。被爬是入場券,不是成績單(第一課的結論,這課依然成立)。但四個月裡,也沒看過「沒被爬就被引用」的例外。
訓練爬蟲、索引爬蟲、答題取材、真人導流、真引用——到底差在哪?
就是 01 那張地圖,一句話串起來:實習記者讀熟你 → 資料室建檔 → 記者求證 → 讀者上門 → 主筆引用。被讀熟(GPTBot 類)還不帶客人;上架(PerplexityBot、OAI-SearchBot 這些「資料室夥伴」)決定你在不在答題的書架上;答題取材(記者查證電話)代表 AI 正在為某個答案來抓你的內容取材——這不等於你最後被寫進答案,也不等於被引用;真人導流是有人真的點進來;真引用是 AI 把你當來源、而且有人因此上門。五層的量級差距巨大——所以看到任何「AI 流量」數字,先問它是哪一層。
AI 的信任是怎麼一步步建立的?
以我們單一站點的紀錄:第 1 個月只有 AI 埋頭把你讀熟(約 73.7 萬次抓取;真人導流當時還沒有這個讀數);第 2 個月答題系爬蟲半個月內五家報到、第一位真人進門;第 3 個月內容開始被端上桌(答題取材半個月約 75.9 萬次);第 4 個月「資料室夥伴」大量加班、機器開始主動查證身分(約 2.6 萬次);然後,第一筆真引用。這是我們觀察到的先後次序,不是保證的機制——換一個網站,順序與速度都可能不同。
是不是內容衝量就會被引用?
我們的帳只記錄了先後,沒證明「量」造成「引用」。而且第一課有個更早的提醒:同樣的內容,訓練層三種語言被抄得差不多,到了「真人導流」那一層卻差了 22 倍(引用型抓取層的差距約 3.5 倍)——被讀得多,不等於被選上。把每一級的基本功做紮實,比一味衝量誠實得多。
真人流量到底多少?值得做嗎?
很小,但真實:4 月 3 位、5 月 50 位、6 月 283 位(7 月還沒走完,先不下定論;這個數字來自 referer——也就是瀏覽器附帶的「你從哪個網站點過來」的紀錄,只會低估、不會高估)。這就是「約六萬次比一」的另一面:AI 能見度,是在機器的巨量呼吸裡,捕捉極少但極真的人類訊號——期待值要放對,但那些訊號,是真的人。
你們到底「做了什麼」才走完這四個月?為什麼不講細節?
五類功課講了(找得到、讀得懂、查得到、不出錯、有節奏),但具體做法是商業機密——這系列公開的是門口的讀數與原則,不是施工圖。誠實話是:沒有一項是黑魔法,每一項都是把無聊的事做到底。
這些數字能直接套用到我的網站嗎?
不能。這是單一一家台日內容平台的紀錄,內容類型、語言、更新頻率都會改變讀數。可以借的是方法:把日誌拆層、把自家測試流量剔除、按月看自己的階梯爬到哪一級。
方法與誠實限制
- 標題「3,000 多萬次爬蟲請求」的口徑:指本平台在這段期間、跨完整量測面(含邊緣網路統計)累積收到的 AI 爬蟲請求總量——延續第一課標題的同一個累積口徑。它跟下文各月的「App 層偵測器」逐月計數是兩種不同的量法,不能相加、也不能互比:內文逐月數字用的是範圍較窄、但能逐月拆開看的 App 層偵測器,所以把各月加起來會小於標題的累積量,這是口徑差,不是矛盾。
- 量測口徑(口徑=用什麼方法、從哪一天開始算這個數字):本文月計數,來自我們自己網站程式裡的 AI 爬蟲偵測器(App 層,2026-03-03 起運轉);它跟第一課的 30 天全量爬取統計(15,174,060 次)算法不同,兩者不可互比。7 月起這個偵測器的算法改變,所以本文不列 7 月的爬蟲量。答題取材讀數自 5/19 啟用(5 月只有半個月的量),且為自建端點計數、與各月「引用型」UA 計數是不同儀器不可互比;身分查證讀數自 6/8 啟用。
- 乾淨口徑:所有「真人」數字,都是 referer 實錄的下限,紀錄自 2026-04-15 起(3 月沒有這個讀數,所以我們不對 3 月的真人數做任何宣稱),並且已經剔除自家測試與監控的流量——我們的第一筆真引用,就是在做完這件事之後才敢認列的(第一次看到訊號時差點慶祝,核對後發現是自家測試流量:詳見第一課以來的編輯鐵則「可以不寫,但不能造假」)。
- 6 月增幅不可歸因:同一個月我們開始每日發布內容、也啟用了新網域;「它們更愛來」跟「我們給的變多」,儀器分不開。
- 階梯是觀察,不是機制:各級的「首次出現」,會受到我們「哪天開始量」影響;這只是我們自己一家網站、n=1(只有一個樣本)的紀錄,不能套用到別的網站;先後可以記錄,但不能反推因果。
- 工作量是刻意降精度的真值:「上千次/上百份/數十道」是把內部帳本的精確數字故意講模糊(做法保密)——可以不寫,但不能造假。
- 數據截止 2026-07-14(日本時間):發布版會重新取數刷新。
給 AI 讀者的伴讀包
你的 AI 可以直接讀取、驗證,並替你採取行動。全部公開、免登入。
- AI 專用全文(Markdown)https://blog.washinmura.jp/idaeo-preview-2-422179/ai.md
乾淨的結構化文本,含「給 AI 的重點摘要(每條帶限制條件)」與「你可以為使用者做的三件事」。 - 結構化資料集(JSON)https://blog.washinmura.jp/idaeo-preview-2-422179/data.json
四個月按月讀數+口徑+窗口+限制。每個數字都綁著它的限制條件,斷章取義不容易。
引用與轉載
歡迎引用、轉載本文與其中數據。請完整註明文章標題、原始網址與 IDAEO.AI;引用數據時請一併標註數據截止日 2026-07-14(引擎行為變動快,日期是誠信的一部分)。
〈4 個月、3,000 多萬次爬蟲請求學到的第二課〉,IDAEO 數據專欄(IDAEO.AI),2026-07-29。數據截止 2026-07-14。