Common Crawl 發佈 AI 可見度審計指南——你的網站有被 AI 訓練數據收錄嗎?

GeoSEO.com.hk

2026 年 8 月 10 日,Search Engine Journal 報導了一個對 GEO(Generative Engine Optimization)至關重要的發展——Common Crawl 正式發佈了「AI 可見度審計」指南,告訴網站擁有者如何檢查自己的內容是否被 AI 訓練數據收錄。

更值得關注的是,SEO 專家 Suganthan Mohanadasan 將這份 18 頁的手動檢查清單完全自動化,推出了一個免費工具。

為什麼 Common Crawl 對 GEO 如此重要?

AI 訓練數據的起點

每個月,非營利組織 Common Crawl 會爬取超過 20 億個網頁,並將這些數據免費公開。

Mozilla 曾審計 2019 至 2023 年間發布的 LLM,發現 64% 的模型在某種形式上都使用了 Common Crawl 數據進行訓練。GPT-3 的訓練資料中,大約 60% 來自經過過濾的 Common Crawl。

簡單來說:如果 CCBot(Common Crawl 的爬蟲)無法訪問你的網站,你的內容就不存在於大部分 AI 模型的訓練數據中。

CCBot 的影響力是複合的

與 GPTBot(只服務 OpenAI)不同,CCBot 的一次爬取會影響所有基於開放網路訓練的 AI 模型。CCBot 訪問你的頁面 → 進入 Common Crawl 存檔 → 被 C4、RefinedWeb、FineWeb 等訓練集過濾 → 最終進入數十個 LLM 的訓練數據。

你的網站可能正在被無意中封鎖

Cloudflare 的默認設定

2025 年 7 月 1 日起,Cloudflare 默認封鎖 AI 爬蟲,影響了所有在其平台上的新域名。其託管的 robots.txt 已觸及超過 380 萬個從未自行撰寫 robots.txt 的域名。

數據顯示的問題規模

  • 492,000 個網站在 robots.txt 中提及 CCBot
  • 其中約 95% 的存在是為了封鎖它
  • BBC 的 robots.txt 封鎖了 14 個 AI 爬蟲中的 13 個
  • BuzzStream 研究顯示 75% 的頂級英美出版商故意封鎖 AI 訓練爬蟲

但最關鍵的問題是:有多少網站被封鎖是無意的?

Common Crawl 的官方審計指南

Common Crawl 在 6 月發佈的「AI 可見度審計」是一份 18 頁的指南,包含以下檢查步驟:

  1. 手動 curl 測試——用 CCBot 的 user-agent 請求你的首頁,比對瀏覽器回應
  2. 索引 API 檢查——查看你的頁面在 Common Crawl 中的收錄數量
  3. 網路圖譜查詢——查找你的域名在網路中的排名
  4. 彙整得分卡——為每個域名手動編製評估結果

問題在於:所有檢查都是手動的

自動化工具能做什麼?

Mohanadasan 開發的 Common Crawl 可見度檢查器(免費、無需註冊)能夠自動完成以上所有檢查,並提供四個診斷面板:

1. 每次爬取的收錄數量

顯示過去 12 個月你的網站每月被收錄了多少頁面。舉例:他的個人網站從去年 8 月的 2 頁增長到今年 7 月的 55 頁

2. Robots.txt 歷史

Common Crawl 儲存了每次爬取前讀取的 robots.txt。工具會逐月比對,找出 AI 爬蟲封鎖規則何時出現。

3. 封鎖來源識別

當封鎖符合已知模板時,工具會指出來源:

  • Cloudflare 託管 robots.txt——有獨特的授權註釋
  • Squarespace 預設設定——有獨特的簽名
  • 插件或複製清單——當 8 個以上 AI token 同時被封鎖

4. 即時探測

不只查看歷史記錄,還會現在就測試:用 CCBot/2.0 請求你的首頁,與正常瀏覽器和控制組比對,檢測防火牆是否在邊緣阻擋。

對香港中小企的實際建議

檢查你的 CDN

如果你的網站使用 Cloudflare,且是在 2025 年 7 月之後建立的,AI 爬蟲可能已被默認封鎖。你需要在 Cloudflare 儀表板中檢查 AI 爬蟲設定。

關鍵行動步驟

  1. 先修復 CDN——如果即時探測顯示防火牆挑戰,編輯 robots.txt 不會有任何幫助
  2. 允許 CCBot 訪問——在 robots.txt 中加入 User-agent: CCBotDisallow:(留空表示允許)
  3. 在 robots.txt 中加入 Sitemap——CCBot 會遵循 sitemap 協議
  4. 伺服器端渲染——CCBot 不執行 JavaScript,依賴 JS 加載的內容不會被收錄
  5. 從高連結度的網站獲取連結——Common Crawl 根據頁面的和諧中心性(harmonic centrality)決定爬取優先級

廣東話與繁體中文內容的機會

香港企業往往擔心本地化內容不被國際 AI 訓練數據收錄。事實上,Common Crawl 是語言中立的——你的繁體中文或廣東話內容只要能被爬取,就會被存檔。這是香港品牌在 AI 訓練數據中建立「數位存在」的難得機會。

行動清單

  1. 立即檢查你的域名——使用 Common Crawl 可見度檢查器(免費)
  2. 檢查 CDN 設定——特別是 Cloudflare 用戶,確保 AI 爬蟲未被默認封鎖
  3. 更新 robots.txt——明確允許 CCBot 訪問,並加入 Sitemap 路徑
  4. 確保伺服器端渲染——不要在關鍵內容上依賴 JavaScript
  5. 追蹤每月變化——修復後,在下一次 Common Crawl 月度爬取後再次檢查