GEO生成式引擎優化

OAI-SearchBot、Claude-SearchBot 設定指南:2026 AI 爬蟲完整攻略

如何設定 OAI-SearchBot 和 Claude-SearchBot?本文教你在 robots.txt 正確設定 AI 搜尋爬蟲,讓 ChatGPT、Claude、Perplexity 等 AI 工具能正確索引你的網站內容,提升 AI 可見度。

10 分鐘
OAI-SearchBot、Claude-SearchBot 設定指南:2026 AI 爬蟲完整攻略

當你在 ChatGPT 問「推薦台北咖啡廳」,它是從哪裡得到答案的?

答案是:AI 爬蟲。

就像 Google 用 Googlebot 爬取網站一樣,OpenAI、Anthropic、Perplexity 等公司也有自己的爬蟲程式,專門抓取網站內容供 AI 使用。

問題是:你的網站設定正確了嗎? AI 爬蟲能順利訪問並理解你的內容嗎?

本文將帶你認識各家 AI 爬蟲、了解如何在 robots.txt 進行設定,以及該採取什麼策略來最大化你的 AI 可見度。


💡 想讓 AI 搜尋引擎找到你的網站?

AI 爬蟲設定只是 GEO 的第一步,讓專家幫你評估完整的 AI 可見度優化策略。

👉 LINE 諮詢 AI 可見度優化


一個網站伺服器圖示,周圍有多個機器人爬蟲圖示正在訪問。每個爬蟲身上標示不同的名稱:GPTBot、ClaudeBot、PerplexityBot。背景有數據流動的線條,呈現「AI 爬蟲抓取網站內容」的概念。

AI 爬蟲是什麼?與傳統搜尋引擎爬蟲的差異

在深入設定細節之前,讓我們先搞清楚 AI 爬蟲和傳統爬蟲有什麼不同。

如果你想了解更多 GEO(生成式引擎優化) 的基本概念,可以先閱讀核心指南。

傳統爬蟲(Googlebot)的運作方式

你應該已經對 Google 的爬蟲機制不陌生:

  1. Googlebot 爬取網頁:發現並讀取網站內容
  2. 建立搜尋索引:將內容存入 Google 資料庫
  3. 根據演算法排名:決定搜尋結果的排序
  4. 使用者搜尋時呈現:顯示相關的搜尋結果

這套系統已經運作超過 20 年,規則成熟、行為可預測。

AI 爬蟲的特性

AI 爬蟲的運作邏輯和目的都不太一樣:

特性 說明
主要目的 訓練 AI 模型,或用於即時搜尋回答
使用方式 內容被 AI 理解後,用於生成回答
抓取邏輯 不是為了排名,而是為了理解內容
行為模式 較新,規則仍在發展中

簡單說,傳統爬蟲關心的是「這個頁面該排第幾名」,而 AI 爬蟲關心的是「這個內容說了什麼」。

兩種用途的 AI 爬蟲

AI 爬蟲大致可分為兩類:

  1. 訓練用途爬蟲:抓取內容用來訓練 AI 模型
  2. 搜尋用途爬蟲:抓取內容用於即時回答問題

這個區分很重要,因為你可能想允許「搜尋用途」的爬蟲(增加曝光),但封鎖「訓練用途」的爬蟲(保護內容)。


主流 AI 爬蟲一覽

目前市場上的 AI 工具百家爭鳴,它們各自有不同的爬蟲。讓我們逐一認識。

OpenAI 系列

OpenAI 是 ChatGPT 的開發公司,擁有多個不同用途的爬蟲:

爬蟲名稱 User-Agent 識別 主要用途
GPTBot GPTBot 用於訓練 GPT 模型
OAI-SearchBot OAI-SearchBot ChatGPT 搜尋結果收錄
ChatGPT-User ChatGPT-User 使用者動作觸發的即時抓取
OAI-AdsBot OAI-AdsBot 驗證 ChatGPT 廣告投放頁面的安全性,不用於訓練模型

關鍵區分:

  • GPTBot:你的內容會被用來「訓練」AI 模型
  • OAI-SearchBot:你的內容會被用來「即時回答」用戶問題

如果你希望 ChatGPT 在回答問題時引用你的網站,需要允許 OAI-SearchBot。

Anthropic 系列

Anthropic 是 Claude 的開發公司:

爬蟲名稱 User-Agent 識別 主要用途
ClaudeBot ClaudeBot 用於訓練 Claude 模型
Claude-User Claude-User 使用者在對話中要求讀取特定網址時的即時抓取
Claude-SearchBot Claude-SearchBot Claude 的搜尋索引

目前狀態:Anthropic 已正式發布爬蟲文件,逐一定義三支爬蟲的用途與封鎖方式。三者是獨立的 User-agent 區塊,擋掉其中一支不會影響另外兩支——所以 Claude-User 一定要單獨設,否則你以為放行了,實際上擋掉的正是使用者主動要求讀取你網站的那條路。

其他 AI 爬蟲

除了 OpenAI 和 Anthropic,還有其他重要的 AI 爬蟲:

爬蟲名稱 所屬公司 主要用途
PerplexityBot Perplexity AI 專注搜尋的 AI 引擎
Google-Extended Google 控制內容是否用於訓練 Gemini、以及 Gemini Apps/Vertex AI 的 grounding
GoogleOther Google 通用研發抓取器,供各產品團隊內部使用
Bytespider 字節跳動 TikTok 母公司的 AI 爬蟲
Meta-ExternalAgent Meta Facebook/Instagram 母公司

這裡最容易搞錯:管 Google AI 訓練的是 Google-Extended,不是 GoogleOther。Google 官方文件寫得很明白,GoogleOther 是 generic crawler,「對 GoogleOther 的抓取偏好不影響任何特定產品」。

另外要注意:Google-Extended 只管訓練與 grounding,不影響 Google 搜尋收錄,也不能用來關掉 AI Overviews 或 AI Mode——那兩者走的是 Googlebot 的一般索引。真的想退出的話,Google 自 2026 年 8 月 31 日起已在 Search Console 提供切換開關,開放給全球網站,可選擇網站是否出現在 AI Overviews、AI Mode 等生成式 AI 搜尋功能中(退出後也不會從這些功能獲得流量與曝光)(Google 官方)。

完整 AI 爬蟲對照表

以下是目前主流 AI 爬蟲的完整列表:

爬蟲名稱 所屬公司 用途分類 建議處理
GPTBot OpenAI 訓練 視需求封鎖
OAI-SearchBot OpenAI 搜尋 建議允許
ChatGPT-User OpenAI 使用者觸發 建議允許
OAI-AdsBot OpenAI 廣告頁面驗證 視需求設定
ClaudeBot Anthropic 訓練 視需求封鎖
Claude-User Anthropic 使用者觸發 建議允許
Claude-SearchBot Anthropic 搜尋 建議允許
PerplexityBot Perplexity 搜尋 建議允許
Google-Extended Google 訓練/grounding 視需求封鎖
GoogleOther Google 通用研發 視需求設定
Bytespider 字節跳動 混合 視需求設定

一個分類圖表,將 AI 爬蟲分為兩大類。左邊是「訓練用途」類別(紅色邊框),包含 GPTBot、ClaudeBot。右邊是「搜尋用途」類別(綠色邊框),包含 OAI-SearchBot、Claude-SearchBot、PerplexityBot。中間有箭頭指向一個「策略選擇」的決策點。

robots.txt 中的 AI 爬蟲設定

了解各家爬蟲後,讓我們進入實際設定環節。

robots.txt 基本語法複習

robots.txt 是放在網站根目錄的純文字檔案,用來告訴爬蟲「哪些內容可以爬、哪些不行」。

基本語法:

User-agent: [爬蟲名稱]
Allow: [允許訪問的路徑]
Disallow: [禁止訪問的路徑]

舉例:


User-agent: Googlebot
Allow: /


User-agent: BadBot
Disallow: /

如何設定 AI 爬蟲

設定 AI 爬蟲的方式和一般爬蟲完全相同,差別只在 User-agent 名稱。

設定 1:允許特定 AI 爬蟲


User-agent: OAI-SearchBot
Allow: /


User-agent: Claude-SearchBot
Allow: /


User-agent: PerplexityBot
Allow: /

設定 2:封鎖特定 AI 爬蟲


User-agent: GPTBot
Disallow: /


User-agent: ClaudeBot
Disallow: /

設定 3:允許搜尋、封鎖訓練(折衷方案)

這是最常見的策略:讓 AI 可以引用你的內容,但不用於模型訓練。


User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /


User-agent: ChatGPT-User
Allow: /

User-agent: Claude-User
Allow: /


User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

該允許還是封鎖 AI 爬蟲?策略分析

這是最多人問的問題。讓我們從不同角度分析。

允許 AI 爬蟲的優點與風險

優點:

好處 說明
增加曝光 內容可被 AI 工具引用,獲得新流量來源
搶佔先機 趁競爭對手還沒意識到,先建立 AI 可見度
免費推薦 被 AI 引用相當於獲得免費推薦
跟上趨勢 AI 搜尋使用率持續上升

風險:

風險 說明
內容被訓練 如果允許訓練爬蟲,內容可能被用於 AI 模型
無法控制 無法控制 AI 如何呈現你的內容

封鎖 AI 爬蟲的優點與風險

優點:

好處 說明
保護內容 內容不會被用於 AI 訓練
控制使用 決定內容的使用方式

風險:

風險 說明
失去曝光 失去在 AI 搜尋結果中曝光的機會
落後競爭者 當競爭對手被 AI 引用,你卻不在

2026 年的封鎖潮與流量現實

2026 年有兩股看似矛盾的趨勢同時發生:

  • AI 爬蟲流量年增 300%:Kinsta 的《The AI & bot traffic reality check》報告引用 Akamai《Digital Fraud and Abuse Report 2025》指出 AI bot 流量一年成長 300%;TollBit 統計至 2025 年底,其網路上約每 31 次造訪就有 1 次來自 AI bot;Cloudflare Radar 2025 年度回顧則指出近 80% 的 AI 爬蟲活動是為了模型訓練(Search Engine Journal 報導)
  • 新聞媒體掀起封鎖潮:79% 的頂級新聞發布商已封鎖至少一個 AI 訓練爬蟲;但同時有 30% 的 AI 爬蟲抓取根本不遵守 robots.txt 的明確權限(Search Engine Journal 報導)

怎麼解讀? 封鎖潮主要是新聞媒體的版權立場——他們靠內容授權變現,立場跟中小企業完全不同。對台灣中小企業的內容站與官網來說,跟著封鎖搜尋用途爬蟲等於在 AI 搜尋裡隱形,把曝光拱手讓給競爭對手。正確做法仍是本文的折衷策略:放行搜尋爬蟲、視需求管理訓練爬蟲,同時留意爬蟲對主機的負擔(高成本的動態頁面如購物車、站內搜尋,可用快取或防火牆規則保護,而不是一刀切封鎖)。

用 Cloudflare 的站要注意什麼

如果你的網站掛在 Cloudflare 後面,2026 年有一條新規則要放進待辦清單。Cloudflare 在 2026 年 7 月 1 日宣布把 AI 爬蟲分成搜尋、代理、訓練三類管理,並強烈建議 AI 業者把不同用途拆成不同爬蟲(Cloudflare 官方)(TechCrunch 報導)。自 2026 年 9 月 15 日起,新加入 Cloudflare 的網域會依是否以廣告營利套用建議預設:以廣告營利的網站預設放行搜尋、訓練設為「Disallow AI Training」、代理爬蟲在有廣告的頁面封鎖;沒有以廣告營利的網站三類預設都放行,兩種預設都可以自行更改(Cloudflare 官方)。

有些媒體把這件事講成「Google Gemini 首當其衝」。但這不是 Cloudflare 官方的認定。真正原因是 Google 用同一支 Googlebot 同時服務搜尋和 Gemini 訓練,是典型的混用爬蟲——當規則要搜尋和訓練分家,混用單一爬蟲的一方改造成本最高,不是被誰針對。

對你來說,重點不是 Google 怎麼改,而是別踩那個最常見的災難:為了擋訓練爬蟲,順手把 OAI-SearchBot、Claude-SearchBot 一起擋掉。我們實際看過客戶站這樣中招,一條粗糙的封鎖規則下去,AI 搜尋整站直接消失。Cloudflare 後台的 bot 管理要照本文折衷策略設:擋訓練、放行搜尋,兩件事分開做。但要注意,自 2026 年 9 月 15 日起 Cloudflare 的「Block」與「Block on pages with ads」設定也會套用到 Googlebot、Bingbot、Applebot 這類搜尋兼訓練的混用爬蟲,選錯設定會連 Google 搜尋一起擋掉。想擋訓練又保留 Google 搜尋,訓練類要選「Disallow AI Training」,不要選「Block」(Cloudflare 官方)。

依網站類型的建議策略

網站類型 建議策略 說明
內容網站 / 部落格 允許所有 最大化曝光機會
電商網站 允許搜尋爬蟲 讓產品被 AI 推薦
企業官網 允許搜尋爬蟲 增加品牌能見度
隱私敏感網站 可考慮封鎖 保護敏感內容
付費訂閱內容 封鎖訓練爬蟲 保護付費內容價值

我的建議

對大多數網站來說,我建議採取折衷策略:

  1. ✅ 允許搜尋用途爬蟲(OAI-SearchBot、Claude-SearchBot、PerplexityBot)
  2. ⚠️ 考慮封鎖訓練用途爬蟲(GPTBot、ClaudeBot)

這樣你既能享受 AI 搜尋曝光的好處,又能保護內容不被用於模型訓練。

想了解更多策略規劃,可以參考 台灣企業 GEO 策略 這篇文章。


💡 不確定該怎麼設定?

每個網站的情況不同,讓專家幫你分析最適合的策略。

👉 LINE 諮詢專業建議


一個天平圖示,左邊是「允許」選項(綠色),標示「曝光」「流量」圖示。右邊是「封鎖」選項(紅色),標示「保護」「控制」圖示。天平下方有文字「找到平衡點」。

實作教學:完整設定範例

理論講完了,讓我們看看實際的完整設定範例。

範例 1:最大化 AI 曝光(允許所有爬蟲)

適合:內容網站、部落格、希望最大曝光




User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /


User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /


User-agent: ClaudeBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: Claude-SearchBot
Allow: /


User-agent: PerplexityBot
Allow: /


User-agent: Google-Extended
Allow: /


User-agent: GoogleOther
Allow: /


User-agent: *
Allow: /


Sitemap: https://你的網域.com/sitemap.xml

範例 2:平衡策略(允許搜尋、封鎖訓練)

適合:大多數商業網站




User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /


User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: GPTBot
Disallow: /


User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: ClaudeBot
Disallow: /


User-agent: Google-Extended
Disallow: /


User-agent: PerplexityBot
Allow: /


User-agent: *
Allow: /


Sitemap: https://你的網域.com/sitemap.xml

範例 3:保守策略(封鎖大部分 AI 爬蟲)

適合:有隱私顧慮或付費內容的網站




User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /


User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Bytespider
Disallow: /


User-agent: OAI-SearchBot
Allow: /public/
Disallow: /members/
Disallow: /premium/


User-agent: *
Disallow: /members/
Disallow: /premium/


Sitemap: https://你的網域.com/sitemap.xml

驗證設定是否生效

設定完成後,請進行以下驗證:

步驟 1:直接檢查檔案

在瀏覽器輸入 https://你的網域.com/robots.txt,確認內容正確顯示。

步驟 2:使用測試工具

  • Google Search Console 的「robots.txt 報告」(舊版的 robots.txt 測試工具已被 Google 退役,介面上找不到了)。這份報告會顯示前 20 個主機的 robots.txt 抓取狀態與錯誤,也可以請求重新抓取
  • 要確認「某個網址有沒有被擋」,改用 GSC 的「網址審查工具(URL Inspection)」
  • 線上 robots.txt 驗證工具

步驟 3:觀察伺服器日誌(進階)

如果你有存取權,可以查看伺服器日誌,觀察各爬蟲的訪問記錄。

注意事項:

  • robots.txt 修改後立即生效
  • 但爬蟲需要再次訪問才會讀取新設定
  • 通常需要數天才能看到效果
  • 無法強制爬蟲立即更新

llms.txt 要不要一起設?

robots.txt 管的是「AI 爬蟲能不能來」。另一個常被一起提到的是 llms.txt:一份用 Markdown 寫給 AI 看的網站說明檔。

檔案 功能 類比
robots.txt 控制訪問權限 門禁系統
llms.txt 提供網站說明(非正式標準,讀不讀由各 AI 業者決定) 放在門口、不一定有人拿的導覽手冊

先看清楚它的實際效果:

  1. Google 官方明講,要出現在 AI Overviews 與 AI Mode 沒有額外要求,不需要另外建立 AI 文字檔或特殊標記(Google 官方);這句只針對 Google 搜尋的 AI 功能
  2. Ahrefs 2026 年 6 月發表的研究(資料期間 2026 年 5 月)顯示,13.7 萬個使用 Ahrefs Web Analytics 的網域中有 28% 發布了 llms.txt,而這些檔案有 97% 在整個 5 月連一次請求都沒收到(Ahrefs)

所以 llms.txt 可以設、成本很低,但目前沒有證據顯示它能提升 AI 搜尋曝光。真正該優先做好的,是上面的 robots.txt:放行 OAI-SearchBot、Claude-SearchBot 這類搜尋爬蟲。

想評估自己的網站要不要設,請參考 llms.txt 是什麼?到底該不該設定?。


純圖形插畫,畫面中沒有任何文字、標題或說明:三個並列的圓形圖示,各自上方有一個綠色打勾——一扇敞開的大門與一個小機器人(爬蟲規則已設定放行)、一個指向不同方向的路標(選擇開放或封鎖策略)、放大鏡檢視一份文件(驗證設定生效);下方另有一個淡灰色、虛線框的小手冊圖示,沒有打勾,代表 llms.txt 只是選配、非必要。右下角一枚綠色完成徽章。白色背景。整張圖不得出現任何文字、字母、數字、年份、網址或品牌logo——純圖形構圖。

常見問題 FAQ

Q1:AI 爬蟲會影響網站效能嗎?

在 2026 年會,而且比多數人以為的嚴重。

Kinsta 的 2026 年報告(分析旗下逾 100 億次請求的基礎設施日誌,並彙整產業研究)指出:AI bot 流量一年成長 300%(引 Akamai 2025 報告),AI bot 的造訪佔比從每 200 次一次上升到每 31 次一次(引 TollBit 2025 年第 4 季數據)。在 Kinsta 自家主機上,單一條防迴圈規則 30 天內就擋下 5.5 億次請求,購物車類的動態網址 24 小時內被打了 767 萬次。

也就是說,伺服器負擔是真實而且顯著的。如果你發現異常流量,可以:

  • 檢查伺服器日誌確認來源
  • 在 robots.txt 設定 Crawl-delay(部分爬蟲支援)
  • 使用 CDN 或防火牆過濾,優先保護購物車、站內搜尋這類每次請求成本都很高的動態頁面

Q2:設定後多久會生效?

robots.txt 修改後立即生效,但:

  • 爬蟲需要再次訪問才會讀取新設定
  • 通常需要幾天到一週
  • 無法強制爬蟲立即更新
  • 耐心等待即可

Q3:可以針對特定頁面或目錄設定嗎?

可以。使用路徑規則即可:

User-agent: GPTBot
Disallow: /members/
Disallow: /premium/
Allow: /public/

這樣 GPTBot 會被禁止訪問 /members/ 和 /premium/ 目錄,但可以訪問 /public/ 目錄。

Q4:如果不設定 robots.txt 會怎樣?

沒有設定 robots.txt,等同於允許所有爬蟲訪問所有內容。

這不一定是壞事,但你會失去控制權。建議至少建立基本設定。

Q5:AI 爬蟲會遵守 robots.txt 嗎?

有些會,但不能當成保證。

Anthropic 公開表示其爬蟲遵守 robots.txt;OpenAI 的 GPTBot、OAI-SearchBot 也以 robots.txt 設定管理,但 OpenAI 註明使用者觸發的 ChatGPT-User 因屬使用者發起,robots.txt 規則可能不適用。但 robots.txt 本質上是自願性協定,沒有任何強制力,實務上有兩個必須知道的反例:

  • TollBit 在 2025 年 Q3–Q4 的統計顯示,約 30% 的 AI 抓取並不遵守 robots.txt 的明確權限
  • Cloudflare 在 2025 年 8 月指控 Perplexity 使用未宣告的隱形爬蟲繞過網站封鎖,並將其從 verified bot 名單移除(Perplexity 否認此指控)

結論:robots.txt 該設還是要設,它是你表達意願最正式的管道;但如果某些內容是「絕對不能被抓」,就必須再加上伺服器層或防火牆(WAF)層的封鎖,不能只靠 robots.txt。


AI 爬蟲設定該記住什麼?完整重點整理

恭喜你讀完這篇完整攻略!讓我們快速複習:

重點 說明
AI 爬蟲的目的 訓練 AI 模型,或用於即時搜尋
主要爬蟲 OpenAI(GPTBot、OAI-SearchBot、OAI-AdsBot)、Anthropic(ClaudeBot、Claude-SearchBot、Claude-User)、PerplexityBot、Google-Extended
設定方式 在 robots.txt 中使用 User-agent、Allow、Disallow
建議策略 允許搜尋爬蟲,視需求決定是否允許訓練爬蟲
llms.txt 可以設、成本低,但沒有證據顯示能提升 AI 搜尋曝光

AI 爬蟲設定只是 GEO 優化的技術基礎。真正要讓 AI 引用你的內容,還需要搭配內容策略、結構優化等綜合考量。


AI 爬蟲設定只是第一步

完整的 GEO 優化需要技術設定加上內容策略的配合。讓專家幫你規劃完整的 AI 可見度優化策略:

👉 LINE 免費諮詢 | 了解服務方案


一個完成設定的成就畫面。中央是一個 robots.txt 檔案圖示,上方有一個綠色勾勾。周圍有多個 AI 工具圖示(ChatGPT、Claude、Perplexity)正在順利訪問網站。背景有慶祝的視覺效果。

延伸閱讀

參考資料


相關文章推薦

LINE @006ljkda QR code

掃描 QR 加入 LINE 好友

或直接點此加好友 →