搜尋引擎與 AI 爬蟲工具箱

robots.txt 產生器與測試

重點摘要:想擋 AI 訓練又保留搜尋曝光,可在 robots.txt 封鎖 GPTBot、ClaudeBot、Google-Extended、CCBot 等 8 個訓練爬蟲,其他爬蟲維持 Allow: /。比對依 RFC 9309:最長相符規則優先,長度相同時 Allow 優先。

1. 產生

2. 測試規則

3. 檢查任何網站

比對規則依 RFC 9309 Robots Exclusion Protocol:最長相符的規則優先,長度相同時 Allow 優先;支援 * 與 $。

常見問題

如何封鎖 AI 訓練爬蟲但保留搜尋曝光?

選「封鎖 AI 訓練、保留搜尋曝光」模式,本站會對 GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、CCBot、meta-externalagent、Bytespider、Amazonbot 寫入 Disallow: /,其他爬蟲(Googlebot、bingbot 等)維持允許,也不影響 OAI-SearchBot 等 AI 搜尋爬蟲。

robots.txt 的 Allow 和 Disallow 衝突時聽誰的?

依 RFC 9309,最長相符的規則優先;如果兩條規則長度相同,Allow 優先。規則路徑支援 * 萬用字元與 $ 結尾符號,本站的測試工具會顯示實際命中的規則。

為什麼我在 User-agent: * 寫的 Disallow 對 AI 爬蟲沒效?

因為被點名的爬蟲只看自己的區塊,不會再套用 User-agent: * 的規則。如果你為 GPTBot 等寫了專屬區塊,想擋的路徑要在那個區塊裡另外列出。

robots.txt 能擋住 ChatGPT-User 嗎?

不一定。ChatGPT-User、Google-Agent 屬使用者觸發的擷取,依官方說明不一定遵守 robots.txt;需要硬性封鎖,應改用防火牆(WAF)。

封鎖所有 AI 爬蟲會有什麼影響?

封鎖 OAI-SearchBot、Claude-SearchBot、PerplexityBot 後,你的網站不會出現在 ChatGPT、Claude、Perplexity 搜尋的引用來源。只想避免內容被拿去訓練的話,封鎖訓練爬蟲就夠了。

參考來源