AI 爬蟲名單與 IP 驗證
重點摘要:本站整理 23 個 AI 與搜尋引擎爬蟲 User-Agent,分成搜尋引擎、AI 搜尋索引、AI 訓練、使用者觸發擷取、robots 選擇退出標記 5 類。輸入 IP 可用業者公布的 IP 清單與反查 DNS 驗證真偽。
伺服器紀錄看到 Googlebot 或 GPTBot,不代表真的是它。輸入 IP,用業者公布的 IP 清單與反查 DNS 驗證。
爬蟲名單
| User-Agent | 業者 | 類型 | 遵守 robots.txt | 驗證方式 | 說明 |
|---|---|---|---|---|---|
Googlebot | 搜尋引擎 | 是 | IP 清單 | Google 搜尋、Google 探索 Google:驗證 Google 爬蟲與擷取工具 | |
Google-Extended | robots 選擇退出標記 | — | — | 只用於 robots.txt,封鎖後不給 Gemini 訓練,不影響 Google 搜尋排名 No Hacks:2026 AI 爬蟲 User-Agent 整理 | |
Google-Agent | 使用者觸發擷取 | 否 | IP 清單 | 使用者要 Gemini 代為瀏覽時發出 Google:驗證 Google 爬蟲與擷取工具 | |
bingbot | Microsoft | 搜尋引擎 | 是 | IP 清單 | Bing、Yahoo 搜尋與 Copilot Bing:驗證 Bingbot 工具 |
Baiduspider | 百度 | 搜尋引擎 | 是 | 反查 DNS:baidu.com、baidu.jp | 百度搜尋 百度搜尋資源平台 |
YandexBot | Yandex | 搜尋引擎 | 是 | 反查 DNS:yandex.ru、yandex.net、yandex.com | Yandex 搜尋 |
Applebot | Apple | 搜尋引擎 | 是 | IP 清單 | Siri、Spotlight、Safari 建議 No Hacks:2026 AI 爬蟲 User-Agent 整理 |
Applebot-Extended | Apple | robots 選擇退出標記 | — | — | 只用於 robots.txt,封鎖後不給 Apple Intelligence 訓練 No Hacks:2026 AI 爬蟲 User-Agent 整理 |
DuckDuckBot | DuckDuckGo | 搜尋引擎 | 是 | — | DuckDuckGo 搜尋 |
DuckAssistBot | DuckDuckGo | AI 搜尋索引 | 是 | — | DuckDuckGo AI 回答 No Hacks:2026 AI 爬蟲 User-Agent 整理 |
GPTBot | OpenAI | AI 訓練 | 是 | IP 清單 | 訓練 OpenAI 模型 OpenAI:爬蟲與使用者代理說明 |
OAI-SearchBot | OpenAI | AI 搜尋索引 | 是 | IP 清單 | ChatGPT 搜尋索引;想出現在 ChatGPT 搜尋結果請允許 OpenAI:爬蟲與使用者代理說明 |
ChatGPT-User | OpenAI | 使用者觸發擷取 | 否(依官方最新說明) | IP 清單 | 使用者在 ChatGPT 要求開啟網址時 OpenAI:爬蟲與使用者代理說明 |
ClaudeBot | Anthropic | AI 訓練 | 是 | IP 清單 | 訓練 Claude 模型 Anthropic:網路爬蟲說明與封鎖方式 |
Claude-SearchBot | Anthropic | AI 搜尋索引 | 是 | IP 清單 | Claude 搜尋品質 Anthropic:網路爬蟲說明與封鎖方式 |
Claude-User | Anthropic | 使用者觸發擷取 | 是 | IP 清單 | 使用者提問時即時擷取 Anthropic:網路爬蟲說明與封鎖方式 |
PerplexityBot | Perplexity | AI 搜尋索引 | 是(實測不一定) | IP 清單 | Perplexity 搜尋索引 Perplexity:爬蟲說明 |
Perplexity-User | Perplexity | 使用者觸發擷取 | 是(實測不一定) | IP 清單 | 使用者提問時即時擷取 Perplexity:爬蟲說明 |
meta-externalagent | Meta | AI 訓練 | 是 | — | 訓練 Meta AI No Hacks:2026 AI 爬蟲 User-Agent 整理 |
Amazonbot | Amazon | AI 訓練 | 是 | — | Alexa 與 Amazon AI No Hacks:2026 AI 爬蟲 User-Agent 整理 |
CCBot | Common Crawl | AI 訓練 | 是 | — | 公開網頁語料庫,許多 AI 模型的訓練來源 No Hacks:2026 AI 爬蟲 User-Agent 整理 |
Bytespider | 字節跳動 | AI 訓練 | 未公開官方說明 | — | 據報為訓練用爬蟲 No Hacks:2026 AI 爬蟲 User-Agent 整理 |
MistralAI-User | Mistral AI | 使用者觸發擷取 | 是 | — | Le Chat 即時擷取 No Hacks:2026 AI 爬蟲 User-Agent 整理 |
怎麼設定比較好?
- 想被 ChatGPT、Claude、Perplexity 搜尋引用:允許 OAI-SearchBot、Claude-SearchBot、PerplexityBot。
- 不想內容被拿去訓練:封鎖 GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、CCBot。
- 封鎖 Google-Extended 不會影響 Google 搜尋排名。
- 使用者觸發的擷取(ChatGPT-User、Google-Agent)不一定遵守 robots.txt。
常見問題
怎麼確認伺服器紀錄裡的 Googlebot 是真的?
用 IP 驗證:Googlebot 可比對 Google 公布的 IP 清單,或反查 DNS 看是否屬於 googlebot.com、google.com。伺服器紀錄裡的 User-Agent 可以偽造,只看名稱不能確定是真的爬蟲。
GPTBot、OAI-SearchBot、ChatGPT-User 差在哪?
三者都是 OpenAI 的爬蟲:GPTBot 用來訓練模型,OAI-SearchBot 建立 ChatGPT 搜尋索引,ChatGPT-User 是使用者在 ChatGPT 要求開啟網址時才發出。想出現在 ChatGPT 搜尋結果,要允許 OAI-SearchBot。
封鎖 Google-Extended 會影響 Google 搜尋排名嗎?
不會。Google-Extended 只用在 robots.txt 當作選擇退出標記,封鎖後內容不給 Gemini 訓練,但不影響 Google 搜尋排名。Apple 的 Applebot-Extended 也是類似用途。
想被 AI 搜尋引用要允許哪些爬蟲?
至少允許 OAI-SearchBot(ChatGPT 搜尋)、Claude-SearchBot(Claude)、PerplexityBot(Perplexity)。若不想內容被訓練,可另外封鎖 GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、CCBot。
哪些爬蟲可以用 IP 清單驗證?
Googlebot、Google-Agent、bingbot、Applebot、GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot 系列、PerplexityBot 系列都有公布 IP 清單;百度、Yandex 則用反查 DNS 驗證。