Allow / Disallow 講的是「能不能抓」;Content Signals 講的是「抓到之後可以拿來幹嘛」。 爬蟲進得來,不代表你同意它把內容拿去訓練模型,或當成 AI 回答的來源。
Content Signals 是 Cloudflare 在 2025 年提出、寫在 robots.txt 裡的新欄位,現在已經隨 Cloudflare 的代管設定鋪到數百萬個網域,IETF 的 AIPREF 工作組也在把它標準化。它拆成三個獨立的 問題,分別表態:
沒寫這一行,健檢會判定成「未表態」,不是「不允許」——但對很多網站經營者來說,這三件事的答案並不一樣: 樂意被搜尋到、也樂意被 AI 回答引用,但不見得想被拿去訓練別人的模型。不寫清楚,這個差異就表達不出來, 只能靠對方自己解讀。
健檢會解析 robots.txt 裡萬用(*)群組底下的 Content-Signal 字串,原文照貼給你看,並把三個欄位的值分別列出來—— yes、no,或者沒寫(未表態)。判定字彙是「允許 / 不允許 / 未表態」,這三種都不是扣分項, 健檢只是誠實反映你有沒有表態,要不要表態、表態成什麼是你自己的決定。
三個欄位可以分開決定,不用全部一致。例如很多內容型網站會選擇 search=yes、ai-input=yes(樂意被引用), 但 ai-train=no(不想被拿去訓練模型)——這組合在 Content Signals 出現之前, robots.txt 的 Allow/Disallow 語法完全表達不出來。
回到 健檢 重跑一次,「內容使用授權(Content Signals)」這一項的三個欄位 應該從 未表態 變成你設定的值,健檢也會把解析出來的原文照貼出來, 方便你核對格式有沒有寫對。
(這個欄位目前還在標準化過程中,不是所有 AI 業者都保證會遵守;表態是把你的立場寫清楚, 不是技術上的強制攔截——真正擋不擋得住,仍然要靠 Allow/Disallow 跟後面 WAF 的設定。)