這不只是爬蟲攻防,而是網路的交換契約正在改寫
Cloudflare 執行長 Matthew Prince 在 Big Technology Podcast 拋出的真正問題是:當網路的主要「讀者」從人類變成代理人,內容供應者為什麼還要無條件承擔創作與頻寬成本?過去二十年有一份沒簽字的契約——網站讓搜尋引擎抓取內容,搜尋引擎送回讀者。生成式 AI 沒有改變抓取,卻把閱讀與決策留在答案介面裡:內容仍被消耗,回訪卻不再是必然。
過去是在門口掛「請勿進入」;Cloudflare 想做的,是讓門口真的站著保全。
這正是 robots.txt 的限制。RFC 9309 說明得很清楚:Robots Exclusion Protocol 是請爬蟲遵守的規則,不是存取授權——像禮貌告示,不像門鎖。Cloudflare 要把意願變成邊緣網路可執行的允許、封鎖與收費。
先校正數據:機器流量不等於 AI 流量
「機器人流量超越人類」是好標題,但口徑要拆。自動化流量包含搜尋索引、監控、掃描、比價與訓練爬蟲,目的與成本各不相同。真正驚人的是成長速度:Cloudflare 以固定客戶群比較 2024 與 2025 年 5 月,Googlebot 請求增加 96%,GPTBot 增加 305%,ChatGPT-User 增加 2,825%(完整分析,僅為其網路觀測,不應外推成全網市占)。
更關鍵的是乘數效應:人類買相機可能開五個網站;購物代理人可平行查詢上千個來源、反覆核對價格規格評價。對使用者是更完整的研究,對網站卻可能是上千次運算與零次真人造訪。
為什麼 Google 必須「排隊」
Google 傳統搜尋把「發現」與「閱讀」分開;AI Overviews 則把摘要與推理搬到搜尋頁。這不是抽象焦慮——Pew Research 對 6.8 萬次搜尋的分析發現:出現 AI 摘要時,點擊傳統結果的比例從 15% 掉到 8%,點擊摘要引用來源的只有 1%,且 26% 的造訪直接結束工作階段(無摘要時為 16%)。
Cloudflare 對 Google 的批評比對 OpenAI 更尖銳,因為 Google 同時控制傳統搜尋與 AI 介面。網站封鎖純 AI 爬蟲只是少了模型曝光;封鎖 Googlebot 卻可能連現有搜尋流量一起失去。Google 雖提供 Google-Extended 排除 Gemini 訓練,卻明說 AI Overviews 是 Search 的一部分——網站無法乾淨地接受傳統搜尋、同時拒絕生成式用途。這給了 Google 別家 AI 沒有的談判籌碼,也解釋了 Cloudflare 集體行動的邏輯:把分散供應者聚合成談判單位。
Pay Per Crawl:HTTP 402 復活,但還不是內容版 Visa
Cloudflare 的 Pay Per Crawl 在 2025 年以私人測試推出,提供允許、收費、封鎖三選項:爬蟲收到 HTTP 402 與價格後重試,Cloudflare 驗證身分、彙總收款再分給網站。技術亮點不是 402,而是「誰在付錢」必須可信——User-Agent 易偽造,因此搭配 Web Bot Auth 與請求簽章,把模糊的抓取變成可稽核的交易。
但把每次請求金融化會撞上三道牆:交易成本(千分之一美元不能每筆走信用卡)、定價(新聞快訊與天氣資料不該同價)、品質(付費後拿到過時內容誰退款)。所以它更像市場的最小可行產品,證明了內容可在 HTTP 層宣告價格,卻還沒證明供需雙方會接受同一套權利語言。2025 年底的 Really Simple Licensing(RSL)1.0 正嘗試用機器可讀方式描述訓練、摘要與付款條件;長期勝負或許不在 Cloudflare 能否收錢,而在這些條款能否跨 CDN 與 AI 公司互通。
商業帳:是護城河,未必立刻是大營收
先把規模放回模型。Cloudflare 2026 年第二季財報 顯示單季營收 6.961 億美元、年增 36%,但 Pay Per Crawl 仍是私測,尚未形成收入。早期更實際的價值是黏著度與飛輪:AI 抓取越多,網站越需要 Bot Management;代理人越普及,越需要 Workers 與 AI Gateway。依 W3Techs,2026 年初約 21% 網站使用 Cloudflare,足以讓一項預設設定改變產業行為。
看空版本同樣有力。若 Cloudflare 同時辨識誰是 AI、決定預設封鎖、驗證爬蟲、顯示價格並彙總付款,它就從網站保全變成內容市場的交易所與清算方。錯誤分類會攔下合法研究爬蟲;收費也不保證創作者公平——大型媒體談高價,小網站陷入價格競爭,AI 平台則可能改買少數權威資料庫,反而擴大資訊不平等。因此透明費率、第三方稽核與跨供應商標準,是它想接手這個市場的前提。
至於 Prince「五年後自動化流量達真人一千倍」的預測,適合當成容量規劃的壓力測試,而非基準——快取、批次查詢、結構化 API 與已授權資料集都會抑制無效抓取。真正該追蹤的不是總請求數,而是四個比率:每次代理任務的來源數、抓取後帶回的有效造訪、每千次抓取的基礎設施成本,以及每千次授權給創作者的淨收入。
代理人商務:小商家的結構性劣勢
這是訪談中最容易被忽略、卻最重要的後果。AI 購物代理人不會被漂亮影片疲勞,理論上有利品質好、預算小的品牌。但真正的問題是「冷啟動」:新商家缺乏評價、交易與退貨紀錄,AI 為降低推薦風險反而偏好資料最完整的大型供應商。Prince 以社區雜貨店為例——人類會為了離家近多付點錢買雞蛋,代理人卻可能直接向庫存、物流與品質資料完整的巨頭下單。可被機器驗證的歷史資料,本身就是一種規模優勢。
所以小商家需要的不是把 SEO 改名成「GEO」,而是可攜、可驗證的數位信用:以 Schema.org Product 描述價格庫存,以 W3C Verifiable Credentials 證明產地與身分,並讓評價與履約紀錄跨平台使用。當代理人代替人類做選擇,品牌就從情感捷徑變成資料介面——未來的品牌資產不只是 Logo,而是一組機器能核驗、商家又能帶走的信任證明。
網路的下一個標準是「可選擇的交換」
這場爭論不能簡化成創作者反科技,也不能把公開網頁全當免費原料。搜尋索引、模型訓練、即時 grounding 與代理人下單是不同用途,合理制度必須讓內容供應者對每種用途分別選擇。最健康的終局是三層並存:robots.txt 保留低成本的意願宣告;RSL 之類的開放標準描述授權與價格;Cloudflare、Fastly 與雲端平台負責執行,但彼此互通、可攜、可稽核。如此一來,Cloudflare 可以是門口保全,卻不必成為唯一的地主。
Cloudflare 放下的不是防火牆,而是一張新的談判桌。真正決定開放網路未來的,不是機器人是否排隊,而是誰制定票價、誰能拒絕、誰能帶走資料,以及最小的創作者是否也坐得到位置。
延伸閱讀
Cloudflare:From Googlebot to GPTBot—2025 年爬蟲流量分析
Cloudflare:Introducing Pay Per Crawl
Pew Research Center:Google AI 摘要如何改變點擊行為