robots.txt 允許不等於 AI 讀得到內容。主流 AI 爬蟲抓的是伺服器回的原始 HTML,不執行 JavaScript——純前端渲染的網站,AI 看到的可能只是一個空的 <div id="root"></div>。
robots.txt 全部開放,健檢的可達性那一項會給你綠燈;但如果網站是純前端渲染(CSR), AI 爬蟲實際讀到的內容可能少到幾乎等於沒有。這是兩件事:能不能進來,跟進來之後看不看得到東西, robots.txt 只回答第一個問題。
健檢會關掉 JavaScript,用跟 AI 爬蟲一樣的方式讀你的首頁,量出能讀到的純文字字數。少於 200 字判定為「沒有內容可讀」,200~500 字之間是「內容單薄」,超過 500 字才算正常。同時會對照 HTML 原始碼的長度跟 <script> 標籤數量——如果 HTML 檔案本身不小,但 script 一大堆、文字卻沒幾個字, 就是典型的「內容都在 JS 裡,沒渲染出來」訊號。
這種情況最常見於整站用 React/Vue 之類的框架直接輸出、沒有搭配伺服器端渲染的網站——瀏覽器裡 JavaScript 跑起來之後畫面正常,人看起來完全沒問題,但 AI 爬蟲不會等 JavaScript 執行完, 它只讀伺服器第一時間回的那份 HTML。
不用整站砍掉重練——大部分框架都有 SSR/SSG 模式(Next.js、Nuxt、SvelteKit 都內建), 優先處理首頁跟產品/服務頁這些你最想被引用的頁面,讓伺服器直接把內容渲染進 HTML 裡再回給瀏覽器,JavaScript 之後照樣可以接手互動,AI 爬蟲那邊已經先讀到完整內容了。
回到 健檢 重跑一次,「AI 讀到的內容」這一項應該從 內容單薄 或 可優化 變成 正常,字數也會明顯變多。你也可以自己用瀏覽器開發者工具停用 JavaScript 重新整理頁面,用肉眼確認內容還在不在——這就是 AI 爬蟲看到的版本。
(這一項只看首頁。如果產品頁、文章頁也是純前端渲染,同樣的問題會發生在那些頁面上,深度健檢的 21 項裡有另外幾項會抽樣檢查其他頁面。)