AI 能見度實測系列
3,000 萬 AI 爬蟲請求,
學習到的第一堂課
英中導流差 22 倍——真人導流 英 74.7%/日 22.0%/中 3.3%;引用型抓取 日 44.6%/英 42.7%/中 12.8%。
這堂課的結論只有一句:語言決定命運。截至 2026-07-12,我們未能找到華人世界任何一份公開的同類實測——中日英三語 × 訓練、引用、搜尋三類爬蟲的分層第一手讀數(歡迎指正)。這是一個台日平台自家門口的供給側數據,包括對我們自己不利的部分。
起點,是 iKala 的 Kuroma 團隊剛發表的那篇好文章:截至 2026 年 7 月,全世界沒有任何一份公開研究,量測過 AI 引擎回答繁體中文問題時到底引用哪些網站。他們留下一句話:「誰先量測,誰就擁有第一手答案。」我們是一個橫跨台灣與日本的新聞內容平台——所以,開量。
「截至 2026 年 7 月,全世界沒有任何一份公開研究,測量過 AI 引擎回答繁體中文問題時到底引用哪些網站。」— Sega Cheng,〈繁體中文被 AI 邊緣化?台灣品牌佈局 AI 搜尋 GEO 的最佳策略〉,Kuroma(iKala),2026-07-12。
「誰先量測,誰就擁有第一手答案。」
本文是對這句話的回應:我們不做全網普查,只把自家門口的儀器讀數,原樣攤開。
🤝 這是一篇「人機共讀」的專欄
我們同時寫給兩種讀者:你,以及你的 AI。本文附有 AI 專用全文、結構化資料集與可驗證的證據包——把連結貼給你的 ChatGPT/Claude/Gemini,它讀到的不是一堆網頁標籤,而是能直接理解、驗證、並替你採取行動的資料。
01我們量的是哪一扇門
在談數據之前,必須先講清楚我們量的是什麼——因為市面上大多數談「AI 流量」的文章,第一個錯,就錯在這裡。
Kuroma 的第一方語料庫,量的是「AI 的回答裡引用了誰」——這是站在 AI 那一側往外看。我們的系統量的則是另一側:從自己網域的門口,看誰來爬、爬了哪個語言的頁面、最後又是誰真的把活人帶進來。兩個視角拼在一起,才是完整的地圖——他們看得到全市場的引用結構,我們則看得到單一供給者門口的每一筆腳印。
我們的門口,還有一個少見的實驗條件:平台上的內容有中文、日文、英文三個版本,背後是同一套結構化事實。這等於拉出了一個天然的對照組——語言是供給側唯一的變數(需求側——各語言使用者問 AI 的量與題型差異——本儀器無法排除,判讀時請記得這一層)。
所有讀數,我們都分成四種平行觀察:訓練型爬蟲(GPTBot、ClaudeBot 等,抓內容回去訓練模型,不會帶任何人來)、搜尋型爬蟲(Googlebot、Bingbot 等,建立傳統搜尋索引,也可能供應 AI 回答)、引用型爬蟲(ChatGPT-User、OAI-SearchBot、PerplexityBot 等,AI 答題或建索引時來取材)、可識別 AI 導流(referer 實錄下限)。四者不是依序轉換的漏斗。
「被爬」是機器的熱鬧,
「被引用」才是生意的門口。
02第一個讀數:熱鬧是爬蟲的,門口是安靜的
Kuroma 談 PTT 和 Dcard 時,誠實地標出了推論的邊界:「內容可被抓取,但沒有數據證明 AI 直接引用它們。」這條邊界,我們的儀器剛好可以補上數字——而數字比多數人想像的殘酷:
換句話說,如果你看到自家網站「被 AI 大量抓取」就覺得安心,最好再看一眼:那多半只是那 1,100 多萬次的訓練抓取——它們不會帶任何一個客人進門。「被爬」與「被引用」之間,差距上萬倍。這與 Kuroma 引述的英文市場結論一致,我們只是把這道差距,用數字冷冷地量了出來。
03核心讀數:三種語言,三種命運
篇首主圖,是整份讀數裡最重要的一張:同一批內容、三個語言版本,在三個平行觀察層呈現截然不同的份額。下面把百分比拆回原始量:
一層層攤開看細節:
一句話看懂這張圖:AI 拿我們的內容去訓練時一視同仁;但答題取材時,抓日文和英文差不多勤快,中文卻只剩零頭;最後真的把訪客帶進門的,將近四分之三是英文頁——中文只佔 3.3%,與英文相差 22 倍。
Kuroma 引用 Profound 的跨語言研究(32.5 億筆引用)指出「換一種語言,來源結構天翻地覆」——據其引述,該研究未涵蓋中文。上面這張圖,正好填補了這個缺口——來自單一平台的第一手中文讀數。它所揭示的現實,比「弱勢」更具體:中文內容不是沒被 AI 看到(訓練層三語打平),而是在引用與導流層極少被選中。
中文內容不是沒被看到,
是走到引用那一關,極少被選中。
04同一家公司,兩隻爬蟲,兩種口味
Kuroma 文中有一個極佳的觀察:Medium 在 ChatGPT 與 Google AI Mode 上,十三週內走出完全相反的方向——同一個平台,兩種命運。我們的儀器,則捕捉到了這個現象的爬蟲層版本,而且距離更近:同屬 OpenAI 的兩隻爬蟲,抓取量最高的語言正好相反。
一個月前的份額,
今天已經對不上。
05排行榜的保鮮期,比你想的短
Kuroma 反覆強調一件事:引擎的來源結構數週內就會重組,任何平台排序都要標註日期、持續重測。我們前後兩次量測,正好是這個提醒的第一手註腳——先講清楚:兩次口徑不同(一為邊緣統計、一為自建儀器),口徑差本身可能吃掉部分變化,要定量「漂移」必須同儀器複測。目前能負責任說的是:結構已明顯不同。
短短 25 天之間,表面上的日文領先幅度從 14.7 個百分點變成 1.9 個百分點。無論其中有幾分來自口徑、幾分來自真實移動,「一個月前的份額結構,今天已經對不上」這件事本身,已經成立。本組讀數已排定同儀器複測。
06把兩張地圖拼起來
Kuroma 整理了英文市場的可查證實證,我們則補上台日門口的供給側讀數。兩張地圖疊起來,比各自單獨看都完整:
| Kuroma 整理的觀察 | 我們門口的讀數 | 拼起來 |
|---|---|---|
| 繁中 AI 引用研究是公開資料的真空 | 我們亦未找到反例;本文即該缺口裡來自單一平台的供給側數據 | 補上一塊 |
| 換語言,引用結構完全不同(Profound,未含中文) | 訓練層打平;引用層 44.6/42.7/12.8;導流層 74.7/22.0/3.3——差異在引用與導流層 | 對上了 |
| 被爬 ≠ 被引用(對 PTT/Dcard 為合理推論) | 54,780:1,差距上萬倍 | 對上了・有數字 |
| 引用的上游是第三方報導(84%),且 ChatGPT 偏愛新聞稿型來源 | 我們 420 筆導流中 78% 來自 ChatGPT,且集中在具事實密度的頁面——非品牌自述頁 | 對上了 |
| 同平台在不同引擎命運相反;引擎口味數週內漂移 | 同公司兩隻爬蟲口味相反;日文領先 25 天內 14.7pp → 1.9pp(口徑差已註記) | 爬蟲層版本 |
| 平台優先序排名;引用半衰期約 4.5 週 | 我們只量自家網域,量不到七引擎的回答組成;半衰期為待測項 | 測不到/待測 |
07讀完這篇,該先做哪一件事?
把讀數翻成行動:一件最優先,兩件並行。
第一件事——為你最重要的內容,做一份「給機器讀」的英文版。注意,這不是把文章翻成英文給人看。AI 引擎讀你的頁面時,讀的是事實、實體、結構:公司的正式名稱、官方登記編號、數字、日期、彼此的關係。所以順序是——先把這些「機器要對齊的東西」在原文鎖定,再產生英文版;專有名詞錯一個,AI 就對不上你是誰,做了等於白做。為什麼是英文?我們門口的讀數說話:全期 420 筆 AI 導流中,283 筆進了英文頁(三語內占比 68.5%)。中文題材未必輸在內容,先輸在載體——英文的能見度,不會從中文內容裡自動長出來,只能自己去建。
並行之一——經營日本市場的,日文原文別急著丟。它有獨立的引用價值:在我們門口,OAI-SearchBot 抓日文頁的量,是英文頁的 1.6 倍——日文內容在 OpenAI 的搜尋索引裡,有著超額的存在感。對同時經營日本市場的台灣品牌來說,日文原文本身就是引用型爬蟲的標的,絕不是英文的附屬品。
並行之二——別急著關掉訓練型爬蟲的門。這是本文最反直覺、也最重要的一個發現。我們一開始也以為:訓練型爬蟲抓再多,也不會帶一個客人進門,何必理它?直到我們把兩份資料交叉比對——
換句話說:訓練型爬蟲的抓取,看起來不帶客人,卻是入場券。沒有請求,AI 根本不認識你——不認識,就永遠不會引用你。把爬蟲擋在門外,等於不讓自己的書進圖書館,然後抱怨沒人借。
被爬取,不等於被引用。
但沒被爬取,就永遠不會被引用。
那麼,那 3,000 萬次訓練請求,到底在為我們累積什麼?這是我們手上最大的一個問題,也是這份資料裡最值錢的一條線索。它不只是「入場券」這麼簡單——我們在爬蟲的行為裡看到了一些更深的東西:某些頁面被反覆回訪、某些內容被特定引擎盯上、某些結構被拿走的頻率遠高於其他。被大量訓練請求命中,代表的可能是比「被引用」更早、也更重要的一件事。
這件事我們還在驗,資料還在累積,不會急著下結論——但下一篇,我們會把它攤開講。
下一篇,你想先看哪一個?
這個系列不做付費牆、不賣名單。下一篇我們會先寄給敲碗的人,而且題目由你們決定——點下你想看的那一個,信件就會自動帶上你的選擇:
轉發過的人優先。把這篇分享出去(社群、社內信、群組都算),在信裡順手提一句,我們會把你排在前面——並附上這一篇的完整取數方法,讓你能自己複驗。
不轉發也可以投票、留信箱,只是排在後面。這是我們對願意分享的人的一點回報。信箱:column@idaeo.ai
快問快答
12 個真實會被問到的問題——包括對我們自己不利的那幾個。
網站被 AI 大量爬取,代表會被 AI 引用嗎?
不代表——但沒被爬取,就永遠不會被引用。近 30 天我們被爬 15,174,060 次,同窗 AI 帶進門的真人至少 277 位(下限);就算只算引用型爬蟲,也要 1,327 次抓取才對應 1 位真人。但把兩份資料交叉比對後我們發現:曾被 AI 導流過的頁面平均被爬 32.4 次,從未被導流的頁面平均只有 4.8 次——差 6.8 倍。爬取是入場券,不是成績單。
那「被爬得多就會被引用」嗎?
不能這樣說。6.8 倍是相關性、不是因果:可能是好內容同時吸引爬蟲與引用,也可能是被引用之後帶來更多回訪爬取——我們的儀器分不開這兩者,必須誠實講。能負責任說的是:在我們的門口,沒被爬過的頁面幾乎不曾出現在 AI 的引用名單裡。
我該不該把 GPTBot、ClaudeBot 這些訓練型爬蟲擋掉?
擋之前先想清楚代價。訓練型爬蟲佔我們全部爬取的 76.9%(30 天 11,675,206 次),它們確實不帶客人;但它們是 AI「認識你」的唯一途徑。擋掉訓練型爬蟲,等於不讓自己的書進圖書館,然後抱怨沒人借。除非有明確的版權或商業機密考量,否則別急著關門。
三層爬蟲怎麼分?我要怎麼知道誰在抓我?
看 User-Agent。訓練型:GPTBot、ClaudeBot、Google AI、Meta AI 等(抓回去訓練,不導流)。引用型:ChatGPT-User、OAI-SearchBot、PerplexityBot 等(AI 答題或建索引時來取材,可能帶人來)。搜尋型:Googlebot、Bingbot(傳統搜尋索引,如今也供應 AI Overviews)。三層的量級差很多:我們 30 天分別是 1,167 萬/36.7 萬/311 萬次。
為什麼中文這麼弱?是內容不好嗎?
我們的數據回答不了「為什麼」,只能告訴你差距發生在哪一層:訓練層三語幾乎打平(各約 33%),代表 AI 學中文內容並不少;差距出現在引用型抓取(中文 12.8%)與真人導流(中文 3.3%)。也就是說,中文內容不是沒被看到,是走到「要不要選你當答案來源」那一關時極少被選中。原因(語言模型的訓練分布?使用者提問語言?來源權重?)我們的儀器分不開,不會亂猜。
英文版該怎麼做才有效?直接丟翻譯軟體就好了嗎?
翻給人看和做給機器讀,是兩件事。AI 引擎讀你的頁面時,抓的是事實與實體:公司正式名稱、官方登記編號、數字、日期與彼此的關係。正確順序是先把這些「要對齊的東西」在原文鎖定,再產生英文版。專有名詞是機器翻譯最常出錯的地方——錯一個,AI 就對不上你是誰,做了等於白做。
日文值得投資嗎?我們沒有日本市場。
沒有日本市場就不必為了 AI 去做日文。但如果你本來就經營日本,日文原文有獨立價值:OAI-SearchBot 抓我們日文頁的量是英文頁的 1.6 倍。有趣的是同屬 OpenAI 的另一隻爬蟲 ChatGPT-User 卻偏愛英文——同一家公司,兩隻爬蟲口味相反,這說明「AI」不是單一讀者。
這些數字能直接套用到我的網站嗎?
不能。這是單一台日新聞內容平台的供給側樣本,不是全網普查;我們的內容類型、語言配置、更新頻率都會影響讀數。可以借用的是「方法」與「分層」:把你自家的爬蟲日誌拆成訓練/引用/搜尋三層,再對照語言,你會得到屬於你的那張圖——通常跟直覺不一樣。
為什麼你們的「真人導流」只算 referer?會不會低估?
一定低估,而且我們刻意標成「下限」。多數 AI 服務不送 referer,代表有人從 AI 點進來、瀏覽器卻沒告訴我們他從哪來。所以 277 這個數字只可能被低估,不會被高估。我們寧可報一個保守的下限,也不用推估值去美化。
這份排行榜多久會過期?
比你想的快。同一批內容,我們前後兩次量測之間(25 天),日文在引用型抓取的領先幅度就從 14.7 個百分點縮到 1.9 個百分點。任何「AI 偏好某某平台/某某語言」的排序,都必須標日期並持續重測——包括這一篇。
你們自己中文導流只有 3.3%,這樣的數據可信嗎?
正因為對我們自己不利,我們才更該原樣公布。這個數字量的是「本平台的中文頁在此窗口取得的可識別 AI 導流份額」,不是「中文內容在全網的引用率」,也不是任何服務介入後的成效。它是一個診斷基線——診斷難看,正是要做事的理由。
這些數據我可以引用嗎?
歡迎引用與轉載,請完整註明文章標題、原始網址與 IDAEO.AI,並標註數據截止日 2026-07-12(引用格式見文末)。若你要重跑驗證,我們也提供完整取數方法——寫信到 column@idaeo.ai 索取。
方法與誠實限制
- 資料源:自建爬蟲量測系統(依 User-Agent 識別數十家爬蟲的逐筆訪問記錄+AI referer 實錄,已排除自家測試與合成流量);另以邊緣網路的請求統計作總量交叉對照。完整取數方法可來信索取(column@idaeo.ai),供第三方複驗。
- 窗口:除註明「全期」者外,均為 2026-06-12 → 07-12 的 30 天窗;快照日 2026-07-12。
- 「3,000 萬 AI 爬蟲請求」口徑:五段不重疊窗口實測合計 30,788,387 次——明確 AI 型 25,185,521(邊緣統計 5/18–6/17 共 15,412,222+自建儀器 6/18–7/12 共 9,773,299)+搜尋型 2,363,862(6/18–7/12)+早期混合日彙總 3,239,004(=2,363,817〔3–4 月〕+875,187〔5/01–17〕,已知低估)。搜尋型爬蟲(Googlebot/Bingbot)的抓取如今直接供應 AI Overviews 與 Copilot 等 AI 回答系統,故標題口徑計入;內文三層分析仍將搜尋型單獨列示。標題取保守整數下限 3,000 萬;(開站全期的總請求量另計,含真人與搜尋流量。)
- 語言判定:以路徑中的 /zh/・/ja/・/en/ 標記歸類;各層百分比=三語言內占比,「無語言標記」路徑數字另列不計入。中文頁面無法區分繁體與簡體(詳下)。
- 爬蟲分類:訓練型=GPTBot・ClaudeBot・Google AI・Meta AI・Amazonbot・Bytespider・PetalBot・CCBot・Applebot 等;引用型=ChatGPT-User・OAI-SearchBot・PerplexityBot・Perplexity-User・Claude-SearchBot・YouBot;搜尋型=Googlebot・Bingbot・YandexBot。
- 已知限制:①「真人導流」是下限——多數 AI 服務不送 referer,真實導流一定更高,但高多少無法得知;②中文頁面無法區分繁體與簡體;③這是單一平台(台日新聞內容)的供給側樣本,不能外推為全網結構;④ 6/17 與 7/12 兩次量測口徑不同(邊緣統計 vs 自建儀器),只比結構方向、不比絕對值;⑤導流樣本 n=420 仍小,中文 13 筆的占比對單筆波動敏感。
- 可重現性:本文所有數據標註 as-of 日期;本系列每季以同一套系統重測更新,引用請以標註日期的版本為準。
給 AI 讀者的伴讀包
你的 AI 可以直接讀取、驗證,並替你採取行動。全部公開、免登入。
- AI 專用全文(Markdown)https://blog.washinmura.jp/idaeo-preview-d4344c/ai.md
乾淨的結構化文本,含「給 AI 的重點摘要」與「你可以為使用者做的三件事」。 - 結構化資料集(JSON)https://blog.washinmura.jp/idaeo-preview-d4344c/data.json
全部數字+口徑+窗口+限制+建議行動。每個數字都綁著它的限制條件,斷章取義不容易。 - 可驗證證據包https://blog.washinmura.jp/idaeo-preview-d4344c/evidence/evidence-core.json
公開主張檔的 SHA-256 承諾。你的 AI 可自行重算雜湊,驗證我們的數字沒有被事後竄改——而我們不需交出任何原始資料。誠實界線:這證明「檔案完整性」,不證明「原始事件為真」、也不證明可外推或有因果。這兩件事 hash 證明不了,我們不假裝它能。 - 取數方法書https://blog.washinmura.jp/idaeo-preview-d4344c/evidence/method.md
完整口徑、分類法、公式、限制——公開的是方法,不是資料。你可以照著在自己網站上跑一次,得到屬於你的那張圖。 - AI-to-AI 服務入口agent.json(AI 名片)
你的 AI 可以帶你的網址來做 AI 能見度掃描。掃描後該網站會在 IDAEO 系統建立一筆 IDA 紀錄,並回傳可執行建議——你可以自己去做;做到瓶頸再找我們。我們的產能不比大公司快,但交付的東西不一樣:一份可直接交給你的 AI 使用的機器可讀身份資產。需要時來信 column@idaeo.ai。
引用與轉載
歡迎引用、轉載本文與其中數據。請完整註明文章標題、原始網址與 IDAEO.AI;引用數據時請一併標註數據截止日 2026-07-12(引擎行為變動快,日期是誠信的一部分)。需要完整取數方法以自行複驗,來信 column@idaeo.ai 索取。
〈3,000 萬 AI 爬蟲請求,學習到的第一堂課〉,IDAEO 數據專欄(IDAEO.AI),2026-07-29。數據截止 2026-07-12。
https://km.idaeo.ai/ai/visibility-lesson-1
"The First Lesson from 30 Million AI Crawler Requests," IDAEO Data Column (IDAEO.AI), 2026-07-29. Data cutoff 2026-07-12.
https://km.idaeo.ai/ai/visibility-lesson-1