AI 爬蟲完整指南:GPTBot、ClaudeBot、PerplexityBot 都在抓你的網站
GPTBot、ClaudeBot、PerplexityBot 等 AI 爬蟲每天都在掃描你的網站,但你知道它們是誰、在做什麼嗎?本指南完整介紹 10 大 AI 爬蟲的用途與行為差異,教你如何透過 robots.txt 精準控制、用 llms.txt 引導 AI 理解你的內容,以及爬取行為與 AI 引用之間的關鍵關係。
AI 爬蟲:你網站的隱形訪客
你的網站每天都有一群特殊的訪客——它們不是人類用戶,而是來自 OpenAI、Anthropic、Google、Meta 等公司的 AI 爬蟲。這些爬蟲掃描你的網頁內容,將資料帶回各自的 AI 系統,用於模型訓練或即時搜尋引用。
理解這些爬蟲是誰、它們在做什麼,以及如何控制它們的存取權限,是 GEO(Generative Engine Optimization)策略中不可忽視的技術基礎。
10 大 AI 爬蟲完整解析
1. GPTBot(OpenAI)
用途:抓取網頁內容用於訓練 OpenAI 的 GPT 系列模型。
User-Agent:GPTBot/1.1
行為特徵:這是 OpenAI 最早公開的爬蟲,專門為模型訓練收集資料。被 GPTBot 抓取的內容可能會被納入未來版本的 GPT 模型訓練資料集中。如果你不希望內容被用於 AI 訓練,可以封鎖此爬蟲,但這不會影響你在 ChatGPT 搜尋中的引用表現。
2. OAI-SearchBot(OpenAI)
用途:為 ChatGPT 的搜尋功能即時索引網頁內容。
User-Agent:OAI-SearchBot/1.0
行為特徵:這是驅動 ChatGPT 搜尋引用的關鍵爬蟲。當用戶在 ChatGPT 中搜尋時,OAI-SearchBot 負責即時檢索相關內容並提供引用來源。**如果你希望品牌在 ChatGPT 搜尋中被引用,務必允許此爬蟲存取。**封鎖 GPTBot 的同時可以獨立允許 OAI-SearchBot。
3. ChatGPT-User(OpenAI)
用途:當 ChatGPT 用戶主動要求讀取特定網址時觸發。
User-Agent:ChatGPT-User/1.0
行為特徵:與前兩者不同,這不是主動爬取的爬蟲,而是由用戶行為觸發。當用戶在對話中貼上網址並要求 ChatGPT 分析內容時,ChatGPT-User 會去抓取該頁面。封鎖此爬蟲會導致 ChatGPT 無法為用戶讀取你的網站內容。
4. ClaudeBot / Claude-Web(Anthropic)
用途:ClaudeBot 用於模型訓練;Claude-Web 用於即時搜尋檢索。
User-Agent:ClaudeBot/1.0、Claude-Web/1.0
行為特徵:Anthropic 已將爬蟲拆分為兩個獨立的 User-Agent。ClaudeBot 是訓練用爬蟲,Claude-Web 則是驅動 Claude.ai 用戶查詢時的即時引用來源。建議策略:封鎖 ClaudeBot(訓練),允許 Claude-Web(引用流量)。
5. PerplexityBot(Perplexity)
用途:為 Perplexity 搜尋引擎索引和檢索網頁內容。
User-Agent:PerplexityBot/1.0
行為特徵:Perplexity 是目前成長最快的 AI 搜尋引擎之一,其爬蟲同時負責索引和即時檢索。值得注意的是,Cloudflare 曾發布報告指出 Perplexity 可能使用未公開的爬蟲輪換 User-Agent 和 IP 來規避 robots.txt 限制。儘管如此,允許 PerplexityBot 仍是獲得 Perplexity 引用的正規途徑。
6. Google-Extended(Google)
用途:控制內容是否被用於 Google 的 AI 功能(如 Gemini 模型訓練和 AI Overview)。
User-Agent:Google-Extended(robots.txt 控制 token)
行為特徵:Google-Extended 並不是一個獨立的爬蟲,而是一個 robots.txt 控制選項。封鎖 Google-Extended 可以阻止你的內容被用於 Gemini 訓練和 AI Overview 生成,但不會影響你在 Google 傳統搜尋中的排名。這是一個重要的區別——你可以繼續享受 Google 搜尋流量,同時選擇退出 AI 訓練。
7. Applebot-Extended(Apple)
用途:控制內容是否被用於 Apple Intelligence 和 Siri 的 AI 功能。
User-Agent:Applebot-Extended(robots.txt 控制 token)
行為特徵:與 Google-Extended 類似,Applebot-Extended 是一個 robots.txt opt-out token,而非獨立爬蟲,因此它不會出現在你的伺服器日誌中。封鎖此 token 可以阻止你的內容被 Apple 的 AI 功能使用,但不影響 Siri 基本搜尋和 Safari 建議功能。
8. Meta-ExternalAgent(Meta)
用途:為 Meta 的 AI 產品(包括 Llama 模型和 Meta AI)收集訓練資料。
User-Agent:Meta-ExternalAgent/1.0
行為特徵:Meta 於 2024 年推出的第一方爬蟲,專門為 Llama 系列模型和 Meta AI 助手收集訓練資料。由於 Meta AI 目前整合在 Facebook、Instagram 和 WhatsApp 中,允許此爬蟲可能有助於你的品牌在 Meta 生態系統中的 AI 回答中出現。
9. Bytespider(ByteDance)
用途:為 ByteDance 的 AI 產品(包括 TikTok 推薦系統和豆包等)收集資料。
User-Agent:Bytespider
行為特徵:這是最具爭議的 AI 爬蟲之一。根據 HAProxy 的報告,Bytespider 在某些網站上佔據了近 90% 的 AI 爬蟲流量。更令人擔憂的是,Bytespider 沒有任何官方文檔頁面,且有報告指出其可能不尊重 robots.txt 規則。大多數網站管理者建議封鎖 Bytespider,除非你有明確的理由需要在 ByteDance 生態中獲得能見度。
10. CCBot(Common Crawl)
用途:為 Common Crawl 開放資料集收集網頁內容。
User-Agent:CCBot/2.0
行為特徵:CCBot 是非營利組織 Common Crawl 的爬蟲,收集的資料被公開提供給研究者和企業使用。許多 AI 模型(包括早期版本的 GPT)的訓練資料都來自 Common Crawl。封鎖 CCBot 可以間接減少你的內容進入未來 AI 模型的可能性,但無法追溯已被收集的資料。
如何設定 robots.txt 管理 AI 爬蟲
理解了各個爬蟲後,接下來是實際操作。以下是一個推薦的 robots.txt 範本,採用「訓練封鎖、搜尋允許」的策略:
# === AI 搜尋爬蟲(建議允許 — 驅動引用流量)===
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-Web
Allow: /
User-agent: PerplexityBot
Allow: /
# === AI 訓練爬蟲(建議封鎖 — 保護內容智財)===
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /
# === 高流量/不合規爬蟲(強烈建議封鎖)===
User-agent: Bytespider
Disallow: /
重要原則
- 逐一列出每個爬蟲:不要使用
User-agent: *的通配符規則來管理 AI 爬蟲,這會影響到正常的搜尋引擎爬蟲。 - 區分訓練與搜尋:OpenAI 和 Anthropic 都已經將訓練爬蟲和搜尋爬蟲分開,善用這一點。
- 定期檢查:AI 公司經常推出新的爬蟲或更改 User-Agent,至少每季度檢查一次。
如何監控 AI 爬蟲活動
設定 robots.txt 後,你需要驗證爬蟲是否真的遵守規則,並了解爬取頻率。以下是監控方法:
伺服器日誌分析
在你的網頁伺服器(Nginx、Apache、Cloudflare)日誌中,搜尋以上提到的 User-Agent 字串。關注以下指標:
- 爬取頻率:哪些爬蟲最活躍?
- 爬取路徑:它們對哪些頁面最感興趣?
- 遵守情況:被封鎖的爬蟲是否仍在存取受限頁面?
- 流量影響:AI 爬蟲是否消耗過多伺服器資源?
使用 CDN/WAF 工具
Cloudflare、Vercel 等平台已內建 AI 爬蟲辨識功能,可以在控制面板中直接檢視 AI 爬蟲的流量統計。Cloudflare 的 Bot Management 還支援按爬蟲類型設定速率限制。
hogiah Agent Analytics
hogiah 的 Agent Analytics 功能可以幫助你追蹤 AI 爬蟲對網站的存取行為,並將爬取數據與引用表現做關聯分析。了解哪些頁面被頻繁爬取卻未獲得引用,有助於你調整內容策略。
爬取與引用的關係
許多人以為「讓 AI 爬蟲抓取就等於會被引用」,但實際關係比這複雜得多:
爬取是必要條件,不是充分條件
AI 搜尋引擎需要先抓取你的內容,才有可能在回答中引用。但被抓取不代表一定會被引用。AI 系統會評估內容的相關性、權威性、新鮮度和結構化程度來決定是否引用。
訓練爬蟲 vs. 搜尋爬蟲的影響
- 訓練爬蟲(GPTBot、ClaudeBot):影響 AI 模型的「知識記憶」,是長期、間接的影響。你的品牌資訊可能出現在模型的參數記憶中。
- 搜尋爬蟲(OAI-SearchBot、Claude-Web):影響即時搜尋引用,是直接的、可追蹤的影響。這些爬蟲的抓取行為直接關聯到用戶查詢時的引用結果。
提升被引用的可能性
了解了這層關係後,你可以採取以下行動來提高 AI 引用率,這也是 GEO 與 SEO 的關鍵差異之一:
- 確保搜尋爬蟲能存取關鍵頁面
- 使用結構化格式:清晰的標題層級、列點、表格、FAQ
- 提供原創數據和觀點:AI 偏好引用具有獨特見解的來源
- 維持內容新鮮度:定期更新重要頁面的資訊
- 使用 hogiah 的引用追蹤 來監控你的引用表現並持續優化
llms.txt:AI 時代的新標準
除了 robots.txt,2024 年由 Answer.AI 的 Jeremy Howard 提出的 llms.txt 正在成為另一個重要的 AI 爬蟲管理標準。
什麼是 llms.txt?
llms.txt 是一個放置在網站根目錄的純文字檔案,以 Markdown 格式提供網站內容的「目錄」。它告訴 AI 系統:
- 網站的核心內容有哪些
- 哪些頁面最重要、應該優先閱讀
- 內容的使用規則和權限
robots.txt vs. llms.txt
| 比較 | robots.txt | llms.txt |
|---|---|---|
| 功能 | 控制爬取存取權限 | 引導 AI 理解內容結構 |
| 對象 | 所有爬蟲(搜尋引擎 + AI) | 專門針對 AI/LLM |
| 語法 | 專用格式 | Markdown |
| 作用 | 「你不能進來」 | 「進來後先看這些」 |
llms.txt 範例
# 你的品牌名稱
> 一句話描述你的品牌和核心業務
## 核心頁面
- [產品介紹](/products): 我們的產品線完整說明
- [服務項目](/services): 各項服務的詳細內容
- [關於我們](/about): 公司背景和團隊介紹
## 最新內容
- [2026年產業報告](/blog/industry-report-2026): 最新產業趨勢分析
- [使用教學](/docs/getting-started): 產品使用入門指南
應該採用 llms.txt 嗎?
llms.txt 目前仍處於早期採用階段,並非所有 AI 爬蟲都支援。但作為前瞻性布局,建議你現在就建立 llms.txt 檔案:
- 準備成本極低(只需要一個 Markdown 檔案)
- 有助於 AI 更準確地理解你的網站結構
- 隨著採用率提升,早期部署的網站可能獲得先行優勢
常見問題 FAQ
Q1:封鎖 AI 爬蟲會影響我的 Google SEO 排名嗎?
不會。封鎖 GPTBot、ClaudeBot、PerplexityBot 等 AI 爬蟲與 Google 搜尋排名完全無關。即使封鎖 Google-Extended,也只會影響 AI Overview 和 Gemini 訓練,不影響傳統搜尋排名。Googlebot 和 Google-Extended 是獨立運作的。
Q2:我應該封鎖所有 AI 訓練爬蟲嗎?
這取決於你的策略。封鎖訓練爬蟲可以保護內容智慧財產權,但也可能降低品牌在 AI 模型「記憶」中的存在感。建議的折衷方案是:封鎖訓練爬蟲,但允許搜尋爬蟲。這樣既保護智財,又能保持 AI 搜尋中的引用能見度。
Q3:robots.txt 真的能有效阻擋 AI 爬蟲嗎?
大部分主流 AI 公司(OpenAI、Anthropic、Google)的爬蟲會遵守 robots.txt。但 robots.txt 本質上是「君子協定」,沒有技術強制力。Cloudflare 的報告指出,某些爬蟲可能會透過輪換 User-Agent 來規避限制。因此,建議搭配 CDN/WAF 的 Bot Management 功能來提供額外的防護層。
Q4:如何知道哪些 AI 爬蟲正在抓取我的網站?
最直接的方法是分析伺服器存取日誌(access log),搜尋本文列出的 User-Agent 字串。使用 Cloudflare 等 CDN 服務的用戶可以在控制面板的 Bot Analytics 中直接查看。hogiah 也提供 Agent Analytics 功能來追蹤 AI 爬蟲活動。
Q5:llms.txt 和 robots.txt 需要同時設定嗎?
建議同時設定。robots.txt 負責控制「誰可以存取」,llms.txt 負責引導「進來後看什麼」。兩者互補而非替代。先確保 robots.txt 正確設定(這是基礎),再建立 llms.txt 作為進階優化。更多關於 AI 搜尋優化策略,請參考我們的 GEO 術語表。
試試 hogiah 免費分析
10 分鐘取得六維度 GEO 評分,了解你的品牌在 AI 搜尋中的表現。
免費開始分析