當你在 ChatGPT 問「推薦台北咖啡廳」,它是從哪裡得到答案的?
答案是:AI 爬蟲。
就像 Google 用 Googlebot 爬取網站一樣,OpenAI、Anthropic、Perplexity 等公司也有自己的爬蟲程式,專門抓取網站內容供 AI 使用。
問題是:你的網站設定正確了嗎? AI 爬蟲能順利訪問並理解你的內容嗎?
本文將帶你認識各家 AI 爬蟲、了解如何在 robots.txt 進行設定,以及該採取什麼策略來最大化你的 AI 可見度。
💡 想讓 AI 搜尋引擎找到你的網站?
AI 爬蟲設定只是 GEO 的第一步,讓專家幫你評估完整的 AI 可見度優化策略。

AI 爬蟲是什麼?與傳統搜尋引擎爬蟲的差異
在深入設定細節之前,讓我們先搞清楚 AI 爬蟲和傳統爬蟲有什麼不同。
如果你想了解更多 GEO(生成式引擎優化) 的基本概念,可以先閱讀核心指南。
傳統爬蟲(Googlebot)的運作方式
你應該已經對 Google 的爬蟲機制不陌生:
- Googlebot 爬取網頁:發現並讀取網站內容
- 建立搜尋索引:將內容存入 Google 資料庫
- 根據演算法排名:決定搜尋結果的排序
- 使用者搜尋時呈現:顯示相關的搜尋結果
這套系統已經運作超過 20 年,規則成熟、行為可預測。
AI 爬蟲的特性
AI 爬蟲的運作邏輯和目的都不太一樣:
| 特性 | 說明 |
|---|---|
| 主要目的 | 訓練 AI 模型,或用於即時搜尋回答 |
| 使用方式 | 內容被 AI 理解後,用於生成回答 |
| 抓取邏輯 | 不是為了排名,而是為了理解內容 |
| 行為模式 | 較新,規則仍在發展中 |
簡單說,傳統爬蟲關心的是「這個頁面該排第幾名」,而 AI 爬蟲關心的是「這個內容說了什麼」。
兩種用途的 AI 爬蟲
AI 爬蟲大致可分為兩類:
- 訓練用途爬蟲:抓取內容用來訓練 AI 模型
- 搜尋用途爬蟲:抓取內容用於即時回答問題
這個區分很重要,因為你可能想允許「搜尋用途」的爬蟲(增加曝光),但封鎖「訓練用途」的爬蟲(保護內容)。
主流 AI 爬蟲一覽
目前市場上的 AI 工具百家爭鳴,它們各自有不同的爬蟲。讓我們逐一認識。
OpenAI 系列
OpenAI 是 ChatGPT 的開發公司,擁有多個不同用途的爬蟲:
| 爬蟲名稱 | User-Agent 識別 | 主要用途 |
|---|---|---|
| GPTBot | GPTBot |
用於訓練 GPT 模型 |
| OAI-SearchBot | OAI-SearchBot |
ChatGPT 搜尋結果收錄 |
| ChatGPT-User | ChatGPT-User |
使用者動作觸發的即時抓取 |
| OAI-AdsBot | OAI-AdsBot |
驗證 ChatGPT 廣告投放頁面的安全性,不用於訓練模型 |
關鍵區分:
- GPTBot:你的內容會被用來「訓練」AI 模型
- OAI-SearchBot:你的內容會被用來「即時回答」用戶問題
如果你希望 ChatGPT 在回答問題時引用你的網站,需要允許 OAI-SearchBot。
Anthropic 系列
Anthropic 是 Claude 的開發公司:
| 爬蟲名稱 | User-Agent 識別 | 主要用途 |
|---|---|---|
| ClaudeBot | ClaudeBot |
用於訓練 Claude 模型 |
| Claude-User | Claude-User |
使用者在對話中要求讀取特定網址時的即時抓取 |
| Claude-SearchBot | Claude-SearchBot |
Claude 的搜尋索引 |
另外還有一支仍被沿用的舊版 User-agent anthropic-ai,設定時可一併考慮。
目前狀態:Anthropic 已正式發布爬蟲文件,逐一定義三支爬蟲的用途與封鎖方式。三者是獨立的 User-agent 區塊,擋掉其中一支不會影響另外兩支——所以 Claude-User 一定要單獨設,否則你以為放行了,實際上擋掉的正是使用者主動要求讀取你網站的那條路。
其他 AI 爬蟲
除了 OpenAI 和 Anthropic,還有其他重要的 AI 爬蟲:
| 爬蟲名稱 | 所屬公司 | 主要用途 |
|---|---|---|
| PerplexityBot | Perplexity AI | 專注搜尋的 AI 引擎 |
| Google-Extended | 控制內容是否用於訓練 Gemini、以及 Gemini Apps/Vertex AI 的 grounding | |
| GoogleOther | 通用研發抓取器,供各產品團隊內部使用 | |
| Bytespider | 字節跳動 | TikTok 母公司的 AI 爬蟲 |
| Meta-ExternalAgent | Meta | Facebook/Instagram 母公司 |
| cohere-ai | Cohere | 企業 AI 解決方案 |
這裡最容易搞錯:管 Google AI 訓練的是 Google-Extended,不是 GoogleOther。Google 官方文件寫得很明白,GoogleOther 是 generic crawler,「對 GoogleOther 的抓取偏好不影響任何特定產品」。
另外要注意:Google-Extended 只管訓練與 grounding,不影響 Google 搜尋收錄,也不能用來關掉 AI Overviews 或 AI Mode——那兩者走的是 Googlebot 的一般索引。
完整 AI 爬蟲對照表
以下是目前主流 AI 爬蟲的完整列表:
| 爬蟲名稱 | 所屬公司 | 用途分類 | 建議處理 |
|---|---|---|---|
| GPTBot | OpenAI | 訓練 | 視需求封鎖 |
| OAI-SearchBot | OpenAI | 搜尋 | 建議允許 |
| ChatGPT-User | OpenAI | 使用者觸發 | 建議允許 |
| OAI-AdsBot | OpenAI | 廣告頁面驗證 | 視需求設定 |
| ClaudeBot | Anthropic | 訓練 | 視需求封鎖 |
| Claude-User | Anthropic | 使用者觸發 | 建議允許 |
| Claude-SearchBot | Anthropic | 搜尋 | 建議允許 |
| PerplexityBot | Perplexity | 搜尋 | 建議允許 |
| Google-Extended | 訓練/grounding | 視需求封鎖 | |
| GoogleOther | 通用研發 | 視需求設定 | |
| Bytespider | 字節跳動 | 混合 | 視需求設定 |

robots.txt 中的 AI 爬蟲設定
了解各家爬蟲後,讓我們進入實際設定環節。
robots.txt 基本語法複習
robots.txt 是放在網站根目錄的純文字檔案,用來告訴爬蟲「哪些內容可以爬、哪些不行」。
基本語法:
User-agent: [爬蟲名稱]
Allow: [允許訪問的路徑]
Disallow: [禁止訪問的路徑]
舉例:
User-agent: Googlebot
Allow: /
User-agent: BadBot
Disallow: /
如何設定 AI 爬蟲
設定 AI 爬蟲的方式和一般爬蟲完全相同,差別只在 User-agent 名稱。
設定 1:允許特定 AI 爬蟲
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
設定 2:封鎖特定 AI 爬蟲
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
設定 3:允許搜尋、封鎖訓練(折衷方案)
這是最常見的策略:讓 AI 可以引用你的內容,但不用於模型訓練。
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
該允許還是封鎖 AI 爬蟲?策略分析
這是最多人問的問題。讓我們從不同角度分析。
允許 AI 爬蟲的優點與風險
優點:
| 好處 | 說明 |
|---|---|
| 增加曝光 | 內容可被 AI 工具引用,獲得新流量來源 |
| 搶佔先機 | 趁競爭對手還沒意識到,先建立 AI 可見度 |
| 免費推薦 | 被 AI 引用相當於獲得免費推薦 |
| 跟上趨勢 | AI 搜尋使用率持續上升 |
風險:
| 風險 | 說明 |
|---|---|
| 內容被訓練 | 如果允許訓練爬蟲,內容可能被用於 AI 模型 |
| 無法控制 | 無法控制 AI 如何呈現你的內容 |
封鎖 AI 爬蟲的優點與風險
優點:
| 好處 | 說明 |
|---|---|
| 保護內容 | 內容不會被用於 AI 訓練 |
| 控制使用 | 決定內容的使用方式 |
風險:
| 風險 | 說明 |
|---|---|
| 失去曝光 | 失去在 AI 搜尋結果中曝光的機會 |
| 落後競爭者 | 當競爭對手被 AI 引用,你卻不在 |
2026 年的封鎖潮與流量現實
2026 年有兩股看似矛盾的趨勢同時發生:
- AI 爬蟲流量年增 300%:Kinsta 的《The AI & bot traffic reality check》報告與 Cloudflare 的基礎設施觀察都指出 AI 爬蟲流量爆發;TollBit 統計至 2025 年底,其網路上約每 31 次造訪就有 1 次來自 AI 爬蟲,且約 80% 的 AI 爬蟲活動與模型訓練相關(Search Engine Journal 報導)
- 新聞媒體掀起封鎖潮:79% 的頂級新聞發布商已封鎖至少一個 AI 訓練爬蟲;但同時有 30% 的 AI 爬蟲抓取根本不遵守 robots.txt 的明確權限(Search Engine Journal 報導)
怎麼解讀? 封鎖潮主要是新聞媒體的版權立場——他們靠內容授權變現,立場跟中小企業完全不同。對台灣中小企業的內容站與官網來說,跟著封鎖搜尋用途爬蟲等於在 AI 搜尋裡隱形,把曝光拱手讓給競爭對手。正確做法仍是本文的折衷策略:放行搜尋爬蟲、視需求管理訓練爬蟲,同時留意爬蟲對主機的負擔(高成本的動態頁面如購物車、站內搜尋,可用快取或防火牆規則保護,而不是一刀切封鎖)。
用 Cloudflare 的站要注意什麼
如果你的網站掛在 Cloudflare 後面,2026 年有一條新規則要放進待辦清單。Cloudflare 在 2026 年 7 月 1 日宣布新政策,要求 AI 業者把「搜尋用」爬蟲和「訓練/代理用」爬蟲分開宣告,並給到 9 月 15 日的期限;期限過後,靠廣告營收的頁面預設會封鎖訓練與代理爬蟲、放行搜尋爬蟲(TechCrunch 報導)。
有些媒體把這件事講成「Google Gemini 首當其衝」。但這不是 Cloudflare 官方的認定。真正原因是 Google 用同一支 Googlebot 同時服務搜尋和 Gemini 訓練,是典型的混用爬蟲——當規則要搜尋和訓練分家,混用單一爬蟲的一方改造成本最高,不是被誰針對。
對你來說,重點不是 Google 怎麼改,而是別踩那個最常見的災難:為了擋訓練爬蟲,順手把 OAI-SearchBot、Claude-SearchBot 一起擋掉。我們實際看過客戶站這樣中招,一條粗糙的封鎖規則下去,AI 搜尋整站直接消失。Cloudflare 後台的 bot 管理要照本文折衷策略設:擋訓練、放行搜尋,兩件事分開做。
依網站類型的建議策略
| 網站類型 | 建議策略 | 說明 |
|---|---|---|
| 內容網站 / 部落格 | 允許所有 | 最大化曝光機會 |
| 電商網站 | 允許搜尋爬蟲 | 讓產品被 AI 推薦 |
| 企業官網 | 允許搜尋爬蟲 | 增加品牌能見度 |
| 隱私敏感網站 | 可考慮封鎖 | 保護敏感內容 |
| 付費訂閱內容 | 封鎖訓練爬蟲 | 保護付費內容價值 |
我的建議
對大多數網站來說,我建議採取折衷策略:
- ✅ 允許搜尋用途爬蟲(OAI-SearchBot、Claude-SearchBot、PerplexityBot)
- ⚠️ 考慮封鎖訓練用途爬蟲(GPTBot、ClaudeBot)
這樣你既能享受 AI 搜尋曝光的好處,又能保護內容不被用於模型訓練。
想了解更多策略規劃,可以參考 台灣企業 GEO 策略 這篇文章。
💡 不確定該怎麼設定?
每個網站的情況不同,讓專家幫你分析最適合的策略。

實作教學:完整設定範例
理論講完了,讓我們看看實際的完整設定範例。
範例 1:最大化 AI 曝光(允許所有爬蟲)
適合:內容網站、部落格、希望最大曝光
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: GoogleOther
Allow: /
User-agent: *
Allow: /
Sitemap: https://你的網域.com/sitemap.xml
範例 2:平衡策略(允許搜尋、封鎖訓練)
適合:大多數商業網站
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: PerplexityBot
Allow: /
User-agent: *
Allow: /
Sitemap: https://你的網域.com/sitemap.xml
範例 3:保守策略(封鎖大部分 AI 爬蟲)
適合:有隱私顧慮或付費內容的網站
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: cohere-ai
Disallow: /
User-agent: OAI-SearchBot
Allow: /public/
Disallow: /members/
Disallow: /premium/
User-agent: *
Disallow: /members/
Disallow: /premium/
Sitemap: https://你的網域.com/sitemap.xml
驗證設定是否生效
設定完成後,請進行以下驗證:
步驟 1:直接檢查檔案
在瀏覽器輸入 https://你的網域.com/robots.txt,確認內容正確顯示。
步驟 2:使用測試工具
- Google Search Console 的「robots.txt 報告」(舊版的 robots.txt 測試工具已被 Google 退役,介面上找不到了)。這份報告會顯示前 20 個主機的 robots.txt 抓取狀態與錯誤,也可以請求重新抓取
- 要確認「某個網址有沒有被擋」,改用 GSC 的「網址審查工具(URL Inspection)」
- 線上 robots.txt 驗證工具
步驟 3:觀察伺服器日誌(進階)
如果你有存取權,可以查看伺服器日誌,觀察各爬蟲的訪問記錄。
注意事項:
- robots.txt 修改後立即生效
- 但爬蟲需要再次訪問才會讀取新設定
- 通常需要數天才能看到效果
- 無法強制爬蟲立即更新
搭配 llms.txt 使用
robots.txt 設定只解決了「AI 能不能來」的問題,但沒有解決「AI 怎麼理解你」的問題。
這就是為什麼你還需要設定 llms.txt。
| 檔案 | 功能 | 類比 |
|---|---|---|
| robots.txt | 控制訪問權限 | 門禁系統 |
| llms.txt | 提供網站說明 | 接待員 |
建議同時設定兩者:
- 在 robots.txt 設定允許 AI 爬蟲訪問
- 在 llms.txt 提供網站的完整說明
詳細的 llms.txt 設定方式,請參考 llms.txt 設定完整教學。

常見問題 FAQ
Q1:AI 爬蟲會影響網站效能嗎?
在 2026 年會,而且比多數人以為的嚴重。
Kinsta 以逾 100 億次請求的基礎設施日誌做的分析(2026 年 6 月發布)指出:bot 流量已經超過人類流量、AI 爬蟲流量一年成長 300%,AI bot 的造訪佔比也從每 200 次一次上升到每 31 次一次。極端案例裡,單一爬蟲 30 天內發出 5.5 億次請求,購物車類的動態網址 24 小時內被打了 767 萬次。
也就是說,伺服器負擔是真實而且顯著的。如果你發現異常流量,可以:
- 檢查伺服器日誌確認來源
- 在 robots.txt 設定 Crawl-delay(部分爬蟲支援)
- 使用 CDN 或防火牆過濾,優先保護購物車、站內搜尋這類每次請求成本都很高的動態頁面
Q2:設定後多久會生效?
robots.txt 修改後立即生效,但:
- 爬蟲需要再次訪問才會讀取新設定
- 通常需要幾天到一週
- 無法強制爬蟲立即更新
- 耐心等待即可
Q3:可以針對特定頁面或目錄設定嗎?
可以。使用路徑規則即可:
User-agent: GPTBot
Disallow: /members/
Disallow: /premium/
Allow: /public/
這樣 GPTBot 會被禁止訪問 /members/ 和 /premium/ 目錄,但可以訪問 /public/ 目錄。
Q4:如果不設定 robots.txt 會怎樣?
沒有設定 robots.txt,等同於允許所有爬蟲訪問所有內容。
這不一定是壞事,但你會失去控制權。建議至少建立基本設定。
Q5:AI 爬蟲會遵守 robots.txt 嗎?
有些會,但不能當成保證。
OpenAI、Anthropic 都公開承諾遵守 robots.txt。但 robots.txt 本質上是自願性協定,沒有任何強制力,實務上有兩個必須知道的反例:
- TollBit 在 2025 年 Q3–Q4 的統計顯示,約 30% 的 AI 抓取並不遵守 robots.txt 的明確權限
- Cloudflare 在 2025 年 8 月指控 Perplexity 使用未宣告的隱形爬蟲繞過網站封鎖,並將其從 verified bot 名單移除(Perplexity 否認此指控)
結論:robots.txt 該設還是要設,它是你表達意願最正式的管道;但如果某些內容是「絕對不能被抓」,就必須再加上伺服器層或防火牆(WAF)層的封鎖,不能只靠 robots.txt。
AI 爬蟲設定該記住什麼?完整重點整理
恭喜你讀完這篇完整攻略!讓我們快速複習:
| 重點 | 說明 |
|---|---|
| AI 爬蟲的目的 | 訓練 AI 模型,或用於即時搜尋 |
| 主要爬蟲 | OpenAI(GPTBot、OAI-SearchBot、OAI-AdsBot)、Anthropic(ClaudeBot、Claude-SearchBot、Claude-User)、PerplexityBot、Google-Extended |
| 設定方式 | 在 robots.txt 中使用 User-agent、Allow、Disallow |
| 建議策略 | 允許搜尋爬蟲,視需求決定是否允許訓練爬蟲 |
| 搭配設定 | 同時設定 llms.txt 效果更好 |
AI 爬蟲設定只是 GEO 優化的技術基礎。真正要讓 AI 引用你的內容,還需要搭配內容策略、結構優化等綜合考量。
AI 爬蟲設定只是第一步
完整的 GEO 優化需要技術設定加上內容策略的配合。讓專家幫你規劃完整的 AI 可見度優化策略:

延伸閱讀
- Search Console AI 成效報告完整指南:爬蟲放行之後,用官方報告驗收 AI 搜尋曝光成效
- 該退出 Google AI 搜尋嗎?英國強制退出機制解讀:爬蟲管理之外,看懂「用途授權」層的全球新規
參考資料
- OpenAI 爬蟲官方文件
- Anthropic 三支 Claude 爬蟲說明(Search Engine Land 報導)
- Google 常見爬蟲官方文件(含 Google-Extended、GoogleOther)
- GEO 生成式引擎優化完整指南
- llms.txt 設定完整教學
- 台灣企業 GEO 策略實戰




