這是健檢裡最常見的需處理項目,也是最快能修好的一項。以下說明規則怎麼影響各家 AI 爬蟲、哪幾行要改,以及改完怎麼複驗。
Google 抓得到你的網站,不代表 AI 抓得到。robots.txt 通常是網站最早設定、也最少回頭檢查的檔案—— 常見的情況是規則寫得太寬、或套用了某個資安外掛/CDN 的預設封鎖清單,把 GPTBot、ClaudeBot 這類 AI 爬蟲也一起擋在外面,而且完全不影響 Google 排名,很容易被忽略。
健檢會用 8 家 AI 爬蟲各自真實的 User-Agent 實際發送請求,對照 robots.txt 的規則, 只要有任何一家被 Disallow 擋下,這一項就會標成 需處理。 下面是一個典型會連 AI 爬蟲一起擋掉的規則:
這兩行的意思是「GPTBot 不能存取網站任何路徑」。常見成因是直接複製別人的 robots.txt 範本、 或用了一次擋掉所有非瀏覽器 User-Agent 的資安設定——原意是擋垃圾爬蟲,結果把 AI 爬蟲也算了進去。
如果 robots.txt 是用 CMS 外掛(例如 Yoast、Rank Math)產生的,改設定介面就好;如果是放在網站根目錄的純文字檔, 要請工程師直接改內容並重新部署。改完記得留著原本允許 Google 等既有搜尋引擎的規則,不要整份清空重寫。
回到 健檢 重跑一次,這一項應該從 需處理 變成 正常,爬蟲清單會收合成一行「8 個 AI 爬蟲的結果一致:可存取」。 如果仍然標成 ⚪ 無法判定,代表 robots.txt 我們讀不到,通常是 WAF 的問題——見 判斷標準。
(如果這一項改完 AI 還是不引用你,問題不在可達性,而在內容或權威。那是另外幾篇的範圍。)