OpenAI 承認 robots.txt 未必阻止 ChatGPT 抓取內容:香港中小企應如何應對 AI 爬蟲?
TL;DR:你以為 robots.txt 封鎖了 AI 爬蟲?其實未必
最新發現:2026 年 8 月,Search Engine Journal 報導了 TollBit 最新發表的「State of the Bots」研究報告,揭露了一個令網站管理員震驚的事實——ChatGPT 的頁面抓取機器人在大量已被 robots.txt 明確封鎖的網站上成功抓取內容。OpenAI 自身的官方文檔更直接承認,robots.txt 的限制「可能不適用於 ChatGPT-User」。這對香港中小企來說至關重要:你可能以為自己已經封鎖了 AI 爬蟲,但你的網站內容可能仍然被 ChatGPT 抓取和使用。
以下是研究的關鍵發現,以及你應該如何應對。
1) 研究揭露的真相:約 15% 的 AI 爬蟲繞過了 robots.txt
TollBit 的最新報告分析了 2026 年上半年歐洲網站的 AI 爬蟲活動,關鍵數據包括:
- 約 15% 的 AI 頁面抓取請求成功到達了網站標記為「不允許」的 URL。
- ChatGPT-User 是繞過 robots.txt 最多的 AI 爬蟲,在歐洲幾乎一半曾經封鎖它的網站上,它仍然成功抓取了內容。
- Bytespider(字節跳動)和 Youbot 同樣在大量被封鎖的網站上成功抓取。
- 相比之下,Claude-User 和 Perplexity-User 的被封鎖率較低,歐洲只有 9% 和 13% 的網站分別封鎖它們。
對於香港中小企而言,如果你在 robots.txt 中加入了封鎖 AI 爬蟲的規則,請注意:這只是一個「請求」,而不是強制指令。並非所有 AI 爬蟲都會遵守。
2) OpenAI 官方怎麼說?「用戶觸發的抓取可能不受 robots.txt 約束」
OpenAI 的爬蟲文檔中有一項關鍵區分:
- OAI-SearchBot:這是決定你的網站是否出現在 ChatGPT 搜尋結果中的爬蟲。它會遵守 robots.txt。
- ChatGPT-User:這是當 ChatGPT 用戶提出問題時,用來即時抓取頁面內容的 Fetch Bot。OpenAI 文檔明確指出,由於這些抓取行為是用戶主動觸發的,robots.txt 的限制可能不適用。
這意味著什麼?如果你在 robots.txt 中同時封鎖了 OAI-SearchBot 和 ChatGPT-User,你確實阻止了網站出現在 ChatGPT 搜尋結果中,但卻無法阻止 ChatGPT 用戶查詢時抓取你的頁面內容——你失去了可見性,卻沒有換來保護。
Perplexity 的 Perplexity-User 也有類似立場,表示 robots.txt 可能不適用於用戶觸發的抓取。而 Anthropic(Claude 的開發者)則持不同意見,表示其三款爬蟲都會遵守 robots.txt。
給香港中小企的建議:不要同時封鎖 OAI-SearchBot 和 ChatGPT-User。如果你想保留在 ChatGPT 搜尋中的可見性,應該只封鎖 ChatGPT-User(如果你擔心內容被抓取),或者只封鎖 OAI-SearchBot(如果你不想出現在搜尋結果中但接受即時抓取)。
3) Cloudflare 將於 9 月 15 日推出新機制
好消息是,Cloudflare 正在推出新的爬蟲控制機制。從 2026 年 9 月 15 日起:
- 新加入 Cloudflare 的域名,其 Training 和 Agent 爬蟲將默認被封鎖在含有廣告的頁面上。
- Search 爬蟲(如 Googlebot、OAI-SearchBot)則保持允許。
- 這個機制將「合規」的決定權從爬蟲本身轉移到網絡層面,不再依賴爬蟲自願遵守 robots.txt。
如果你是使用 Cloudflare 的香港中小企,這項更新將在 9 月中生效,為你的網站提供更可靠的 AI 爬蟲控制。
4) 香港中小企的 5 個應對策略
策略一:區分不同 AI 爬蟲,精準設定 robots.txt
不要一刀切封鎖所有 AI 爬蟲。檢查你的 robots.txt,確保你了解每個爬蟲的用途:
OAI-SearchBot— 控制 ChatGP 搜尋中的可見性,保留它以維持 AI 搜尋曝光。ChatGPT-User— 即時抓取爬蟲,可考慮封鎖以防止未授權的內容抓取。GPTBot— 訓練數據爬蟲,可封鎖以防止內容用於模型訓練。Claude-Web/Claude-User— Anthropic 的爬蟲,據稱會遵守 robots.txt。Perplexity-User— Perplexity 的爬蟲,可能繞過 robots.txt。
策略二:使用伺服器日誌或 CDN 確認實際抓取情況
robots.txt 只顯示了你的「請求」,不顯示實際發生的情況。建議定期檢查伺服器日誌或 CDN 報告,看看哪些 AI 爬蟲實際到達了你的網站。如果發現 ChatGPT-User 繞過了你的封鎖,你至少可以了解實際情況,而不是盲目相信 robots.txt。
策略三:考慮 Cloudflare 或其他網絡層級保護
如果你的網站使用 Cloudflare,等待 9 月 15 日的更新,或者考慮其他網絡層級(而非 robots.txt 層級)的 AI 爬蟲控制方案。網絡層級的封鎖比 robots.txt 更難被繞過。
策略四:不要為了封鎖爬蟲而犧牲 AI 搜尋可見性
對於香港中小企來說,AI 搜尋(ChatGPT Search、Perplexity 等)正在成為重要的流量來源。如果為了防止內容被抓取而完全封鎖所有 AI 爬蟲,你可能同時失去了在 AI 搜尋結果中出現的機會。建議採取「選擇性封鎖」策略,只封鎖你確實想要阻止的特定爬蟲。
策略五:定期檢查 AI 爬蟲政策更新
AI 爬蟲的政策正在快速演變。OpenAI、Anthropic、Perplexity 等公司可能會隨時修改其爬蟲行為。建議每月檢查一次各大 AI 公司的爬蟲文檔,確保你的 robots.txt 策略仍然有效。
5) 總結:不要盲目相信 robots.txt
2026 年 8 月的這項研究給所有網站管理員敲響了警鐘:robots.txt 只是一個自願遵守的協議,不是防火牆。AI 爬蟲的行為正變得越來越複雜,部分爬蟲明確表示可能不會遵守 robots.txt 的限制。
對香港中小企來說,關鍵是要從「一刀切封鎖 AI 爬蟲」轉變為「策略性管理 AI 爬蟲存取」。了解不同爬蟲的用途、追蹤實際抓取行為、使用多層級保護,才能在 AI 時代平衡內容保護與搜尋可見性。
如果你不確定自己的 robots.txt 設定是否正確,或者需要專業協助制定 AI 爬蟲管理策略,歡迎聯絡我們進行免費諮詢。
想確保網站在 AI 時代的安全與可見性?
我們可以為您的網站進行 AI 爬蟲審計,檢查 robots.txt 配置、分析伺服器日誌中的 AI 爬蟲活動,並制定平衡內容保護與 AI 搜尋可見性的完整策略。
SEO Company 為香港中小企提供:技術 SEO 審計、AI 爬蟲管理諮詢、robots.txt 優化,以及 GEO 策略規劃等專業服務。