技術 SEO

50 個大型網站 AI 就緒程度審計:大多數 SEO 仍未優化嘅技術信號——香港技術 GEO 指南

2026年9月4日Hong Kong SEO 團隊閱讀時間:5 分鐘

AI 可見度唔只得引用同提及

2026 年 9 月 1 日,Search Engine Journal 發表咗一篇由 SALT.agency 聯合創辦人 Reza Moaiandin 撰寫嘅重磅研究。研究團隊審計咗 50 個橫跨零售、SaaS、旅遊、出版同金融嘅大型網站,評估佢哋嘅 AI 就緒程度。結果發現一個令人震驚嘅差距:絕大部分網站已經做到讓 AI「讀到」內容,但幾乎冇網站做到讓 AI「讀懂」內容。

研究採用咗一個三層 AI 可見度框架,分別係可檢索性(Retrievability)、歸因與語義(Attribution & Meaning)、代理交易與發現(Agent Transaction & Discovery)。呢個框架對於香港企業嚟講係一個難得嘅技術 GEO 藍圖。

三層 AI 可見度框架解析

第一層:可檢索性(Retrievability)——平均 74.4%

呢層係 AI 能否順利獲取同解析你內容嘅基礎能力,同傳統技術 SEO 重疊最多。審計結果顯示大部分網站表現良好,只有 3 個網站低於 50%。審計元素包括:

  • robots.txt 與 AI 用戶代理指令:設定 GPTBot、ClaudeBot、Google-Extended、Applebot-Extended 等 AI 爬蟲嘅存取權限
  • 無障礙樹完整性:確保 accessibility tree 正確反映頁面結構——呢個係 AI 代理讀取你網站嘅主要方式
  • ARIA 標籤與描述性名稱:為互動元素提供清晰嘅機器可讀標籤
  • 語義 HTML 與文件層級結構:正確使用 h1-h6、nav、main、article 等語義標籤
  • Token 高效 DOM 密度:減少冗餘 DOM 節點,降低 AI 處理嘅 token 消耗
  • 服務端渲染/乾淨 HTML 傳遞:確保核心內容喺服務端 HTML 中可見,唔依賴客戶端 JavaScript
  • 表單輸入機器可用性:確保 AI 能夠識別同操作你網站嘅表單元素
  • Sitemap 宣告:提供完整嘅 XML sitemap

對香港網站嘅建議:如果貴網站仲未設定 AI crawler 嘅 robots.txt 指令,或者依賴大量 JavaScript 渲染內容,第一層係你嘅優先改善領域。可以參考我哋嘅 llms.txt 與 AI 爬蟲技術 GEO 指南

第二層:歸因與語義(Attribution & Meaning)——平均 38.5%

呢層嘅分數急劇下跌,係目前最大嘅優化機會。審計元素包括:

  • JSON-LD Schema 與語義豐富度:好消息係 50 個網站中有 35 個(70%)嘅首頁檢測到 JSON-LD 結構化資料。但壞消息係仍然有近三分一嘅網站完全冇
  • Content Signals Policy:只有 5 個網站實施咗 Cloudflare 嘅 Content Signals Policy——呢個係 robots.txt 內嘅擴展指令,精確說明 crawler 可以用你嘅內容做咩(搜尋索引、即時 AI 查詢回應、模型訓練)

Schema 係 AI 理解你內容實際含義嘅關鍵:呢個係產品、呢個係價格、呢個係賣佢嘅品牌。缺乏 Schema 可能唔會影響可檢索性——LLM 仍然會盡力猜測——但猜錯嘅後果可以係錯誤嘅 AI 回應或者直接嘅幻覺。

Content Signals Policy 更加重要。冇呢個政策,你嘅 AI 策略就局限於一個二元選擇——「封鎖所有 AI」或者「允許所有 AI」——而唔能夠精確控制邊啲 crawler 可以做咩。對於香港企業嚟講,如果你嘅網站有敏感內容(例如價格策略、獨家產品資訊),Content Signals Policy 可以讓你授權 crawler 用於即時查詢回應嘅同時,禁止佢哋用同一內容訓練模型。

第三層:代理交易與發現(Agent Transaction & Discovery)——平均 2.1%

呢層嘅分數基本上可以忽略,反映咗 AI 代理交易係 2025 年底先開始出現嘅全新領域。13 個審計元素中只有 2 個被歸類為「已成熟」:

  • OAuth 授權伺服器發現:讓 AI 知道可以點樣安全地訪問你嘅 API
  • OAuth 受保護資源元數據:定義 AI 可以訪問邊啲資源同點樣進行身份驗證

審計結果顯示,除咗 airbnb.com 同 vercel.com 部分實施咗 OAuth 授權伺服器元數據之外,46 個可測試網站中有 46 個得分為零。呢個意味住目前幾乎所有大型網站都未準備好讓 AI 代理代表用戶執行交易操作。

研究團隊同時密切關注 9 個「新興」元素,包括 Model Context Protocol(MCP)、Google 嘅 Universal Commerce Protocol(UCP)同 OpenAI 嘅 Agentic Commerce Protocol(ACP)。呢啲協議將允許 AI 直接查詢你嘅即時產品數據庫、喺對話中完成交易。關於 MCP 嘅更多資訊可以參考我哋嘅 WebMCP 與 AI Agent 網站準備指南

關鍵發現:近三分二網站冇做任何 AI 存取決定

研究中最令人擔憂嘅發現係:50 個網站中有 29 個(58%)冇對 AI 爬蟲存取做出任何明確決定。冇封鎖任何 crawler,亦冇明確允許——完全放任 crawler 自行決定。喺呢啲情況下,AI bot 可以訪問咩內容、點樣解讀、點樣使用,完全取決於運氣。

相比之下,Airbnb、eBay、Cloudflare 等網站都有清晰嘅 AI 策略——即使策略係「封鎖所有 AI」(例如 Amazon 同 BBC)。佢哋嘅 robots.txt 有針對每個主要 AI crawler 嘅具體規則,而唔係交畀默認設定決定。

llms.txt:未成熟但值得關注

研究中將 llms.txt 歸類為「前沿」元素——即尚未被標準化機構認可嘅協議。50 個網站中有 11 個已經發布咗 llms.txt 文件。但研究用 Expedia 嘅例子提出咗一個重要警示:Expedia 寫咗一個出色嘅 llms.txt 文件,但網站整體 AI 架構得分只有 33.3%——冇 JSON-LD、冇 sitemap 宣告、只有 25% 嘅內容係服務端渲染。

正如作者所講:「寫一個優秀嘅 llms.txt 而忽略其他建設,就好似喺櫥窗貼『營業中』但唔記得開門。」呢個提醒對香港企業尤其重要——llms.txt 係補充,唔係替代。

低分數唔一定係壞分數

研究團隊強調,低分唔一定代表網站準備不足。Amazon 嘅 AI 就緒得分只有 29.2%,但呢個係刻意嘅決定——Amazon 選擇封鎖幾乎所有 AI crawler。同樣,BBC、CNN、Guardian 等新聞媒體嘅商業模式依賴用戶直接訪問網站,所以封鎖 AI 係合理嘅商業策略。

但對於香港嘅零售、SaaS、旅遊同金融服務企業,依賴 AI 渠道接觸客戶嘅程度只會持續增加。當越來越多客戶通過 AI 代理(而非直接訪問網站)同你互動嗰陣,三層框架嘅每一層都會變得越來越重要。

香港網站 AI 準備度檢查清單

  • 第一層優先:設定 robots.txt,為 GPTBot、ClaudeBot、Google-Extended、Applebot-Extended 等主要 AI crawler 制定明確嘅存取規則
  • 語義 HTML 審計:確保網站使用正確嘅語義標籤(h1-h6、nav、main、article、aside)
  • 服務端渲染檢查:確認核心內容喺服務端 HTML 中可見,唔依賴 JavaScript 渲染
  • JSON-LD Schema 實施:至少喺首頁同意義重要頁面(產品頁、服務頁)加入 Product/Service/Organization Schema
  • 考慮 Content Signals Policy:如果你嘅內容有商業敏感性,實施 Cloudflare Content Signals Policy 精確控制 AI 使用方式
  • 評估 OAuth 準備度:如果貴公司有 API 或計劃支援 AI 代理交易,開始研究 OAuth 授權伺服器設定
  • 監測 MCP/UCP/ACP 發展:呢啲協議將會迅速成熟,早啲了解可以獲得先發優勢
  • llms.txt 補充:喺做好以上基礎後,建立 llms.txt 提供 AI 友好嘅網站摘要
  • 定期 AI 準備度審計:每季度使用類似 SALT.agency 嘅框架重新評估網站嘅 AI 就緒狀態

關於更多技術 GEO 嘅實作細節,可以參考我哋嘅 技術 SEO 完整指南

← 返回網誌列表