Common Crawl 發佈 AI 可見度審計指南——你的網站有被 AI 訓練數據收錄嗎?
2026 年 8 月 10 日,Search Engine Journal 報導了一個對 GEO(Generative Engine Optimization)至關重要的發展——Common Crawl 正式發佈了「AI 可見度審計」指南,告訴網站擁有者如何檢查自己的內容是否被 AI 訓練數據收錄。
更值得關注的是,SEO 專家 Suganthan Mohanadasan 將這份 18 頁的手動檢查清單完全自動化,推出了一個免費工具。
為什麼 Common Crawl 對 GEO 如此重要?
AI 訓練數據的起點
每個月,非營利組織 Common Crawl 會爬取超過 20 億個網頁,並將這些數據免費公開。
Mozilla 曾審計 2019 至 2023 年間發布的 LLM,發現 64% 的模型在某種形式上都使用了 Common Crawl 數據進行訓練。GPT-3 的訓練資料中,大約 60% 來自經過過濾的 Common Crawl。
簡單來說:如果 CCBot(Common Crawl 的爬蟲)無法訪問你的網站,你的內容就不存在於大部分 AI 模型的訓練數據中。
CCBot 的影響力是複合的
與 GPTBot(只服務 OpenAI)不同,CCBot 的一次爬取會影響所有基於開放網路訓練的 AI 模型。CCBot 訪問你的頁面 → 進入 Common Crawl 存檔 → 被 C4、RefinedWeb、FineWeb 等訓練集過濾 → 最終進入數十個 LLM 的訓練數據。
你的網站可能正在被無意中封鎖
Cloudflare 的默認設定
2025 年 7 月 1 日起,Cloudflare 默認封鎖 AI 爬蟲,影響了所有在其平台上的新域名。其託管的 robots.txt 已觸及超過 380 萬個從未自行撰寫 robots.txt 的域名。
數據顯示的問題規模
- 約 492,000 個網站在 robots.txt 中提及 CCBot
- 其中約 95% 的存在是為了封鎖它
- BBC 的 robots.txt 封鎖了 14 個 AI 爬蟲中的 13 個
- BuzzStream 研究顯示 75% 的頂級英美出版商故意封鎖 AI 訓練爬蟲
但最關鍵的問題是:有多少網站被封鎖是無意的?
Common Crawl 的官方審計指南
Common Crawl 在 6 月發佈的「AI 可見度審計」是一份 18 頁的指南,包含以下檢查步驟:
- 手動 curl 測試——用 CCBot 的 user-agent 請求你的首頁,比對瀏覽器回應
- 索引 API 檢查——查看你的頁面在 Common Crawl 中的收錄數量
- 網路圖譜查詢——查找你的域名在網路中的排名
- 彙整得分卡——為每個域名手動編製評估結果
問題在於:所有檢查都是手動的。
自動化工具能做什麼?
Mohanadasan 開發的 Common Crawl 可見度檢查器(免費、無需註冊)能夠自動完成以上所有檢查,並提供四個診斷面板:
1. 每次爬取的收錄數量
顯示過去 12 個月你的網站每月被收錄了多少頁面。舉例:他的個人網站從去年 8 月的 2 頁增長到今年 7 月的 55 頁。
2. Robots.txt 歷史
Common Crawl 儲存了每次爬取前讀取的 robots.txt。工具會逐月比對,找出 AI 爬蟲封鎖規則何時出現。
3. 封鎖來源識別
當封鎖符合已知模板時,工具會指出來源:
- Cloudflare 託管 robots.txt——有獨特的授權註釋
- Squarespace 預設設定——有獨特的簽名
- 插件或複製清單——當 8 個以上 AI token 同時被封鎖
4. 即時探測
不只查看歷史記錄,還會現在就測試:用 CCBot/2.0 請求你的首頁,與正常瀏覽器和控制組比對,檢測防火牆是否在邊緣阻擋。
對香港中小企的實際建議
檢查你的 CDN
如果你的網站使用 Cloudflare,且是在 2025 年 7 月之後建立的,AI 爬蟲可能已被默認封鎖。你需要在 Cloudflare 儀表板中檢查 AI 爬蟲設定。
關鍵行動步驟
- 先修復 CDN——如果即時探測顯示防火牆挑戰,編輯 robots.txt 不會有任何幫助
- 允許 CCBot 訪問——在 robots.txt 中加入
User-agent: CCBot和Disallow:(留空表示允許) - 在 robots.txt 中加入 Sitemap——CCBot 會遵循 sitemap 協議
- 伺服器端渲染——CCBot 不執行 JavaScript,依賴 JS 加載的內容不會被收錄
- 從高連結度的網站獲取連結——Common Crawl 根據頁面的和諧中心性(harmonic centrality)決定爬取優先級
廣東話與繁體中文內容的機會
香港企業往往擔心本地化內容不被國際 AI 訓練數據收錄。事實上,Common Crawl 是語言中立的——你的繁體中文或廣東話內容只要能被爬取,就會被存檔。這是香港品牌在 AI 訓練數據中建立「數位存在」的難得機會。
行動清單
- 立即檢查你的域名——使用 Common Crawl 可見度檢查器(免費)
- 檢查 CDN 設定——特別是 Cloudflare 用戶,確保 AI 爬蟲未被默認封鎖
- 更新 robots.txt——明確允許 CCBot 訪問,並加入 Sitemap 路徑
- 確保伺服器端渲染——不要在關鍵內容上依賴 JavaScript
- 追蹤每月變化——修復後,在下一次 Common Crawl 月度爬取後再次檢查