robots.txt 要怎麼寫,AI 爬蟲才進得來?

這是健檢裡最常見的需處理項目,也是最快能修好的一項。以下說明規則怎麼影響各家 AI 爬蟲、哪幾行要改,以及改完怎麼複驗。

2026-05-14積木媒體行銷2 分鐘

Google 抓得到你的網站,不代表 AI 抓得到。robots.txt 通常是網站最早設定、也最少回頭檢查的檔案—— 常見的情況是規則寫得太寬、或套用了某個資安外掛/CDN 的預設封鎖清單,把 GPTBot、ClaudeBot 這類 AI 爬蟲也一起擋在外面,而且完全不影響 Google 排名,很容易被忽略。

問題長什麼樣

健檢會用 8 家 AI 爬蟲各自真實的 User-Agent 實際發送請求,對照 robots.txt 的規則, 只要有任何一家被 Disallow 擋下,這一項就會標成 需處理。 下面是一個典型會連 AI 爬蟲一起擋掉的規則:

User-agent: GPTBot Disallow: /

這兩行的意思是「GPTBot 不能存取網站任何路徑」。常見成因是直接複製別人的 robots.txt 範本、 或用了一次擋掉所有非瀏覽器 User-Agent 的資安設定——原意是擋垃圾爬蟲,結果把 AI 爬蟲也算了進去。

怎麼修

打開 https://你的網域/robots.txt,找出所有 AI 爬蟲的規則
5 分鐘
移除或改寫對 GPTBot、ClaudeBot、PerplexityBot 的 Disallow
工程師
順手補上 Content Signals 與 llms.txt 的表態
選配

如果 robots.txt 是用 CMS 外掛(例如 Yoast、Rank Math)產生的,改設定介面就好;如果是放在網站根目錄的純文字檔, 要請工程師直接改內容並重新部署。改完記得留著原本允許 Google 等既有搜尋引擎的規則,不要整份清空重寫。

改完怎麼複驗

回到 健檢 重跑一次,這一項應該從 需處理 變成 正常,爬蟲清單會收合成一行「8 個 AI 爬蟲的結果一致:可存取」。 如果仍然標成 ⚪ 無法判定,代表 robots.txt 我們讀不到,通常是 WAF 的問題——見 判斷標準

(如果這一項改完 AI 還是不引用你,問題不在可達性,而在內容或權威。那是另外幾篇的範圍。)

本文對應的檢測項目

AI 爬蟲的存取權限

可存取 / 被擋 / 無法判定 / 政策允許但實測被擋

檢測我的網站
相關文章