片段控制 — 5 個檢查點 1 2 3 4 5 無自殘指令 落點正確 鎖對東西 長度策略 邊界與維運 meta robots 乾淨 data-nosnippet 不蓋錯區 預設全開・例外上鎖 max-snippet 用 -1 或不設 鎖只對 Google/Bing 生效 一行 nosnippet 能讓其他 11 維的努力歸零 — 先確認沒自殘,再談策略。

在瀏覽器打開你的網站,按 Ctrl+U 看原始碼,搜尋 nosnippet。如果找到一行 <meta name="robots" content="nosnippet">,你就找到了整站 GEO 最貴的一行字:照 Google 現行官方文件,這行指令除了拿掉搜尋結果的文字預覽,也同時把你的內容從 AI Overviews 與 AI Mode 的引用輸入裡拿掉

而有這行的網站,多半不記得它是誰加的——常見來源是多年前某任 SEO 顧問防內容農場抄襲的手筆,或某個 SEO 外掛的全域設定。指令還在,當年的理由早就不在了。

TL;DR

片段控制是 12 維度裡的「防呆維度」:多數網站的問題是亂擋而非沒擋。nosnippetmax-snippetdata-nosnippet 這組 2019 年為搜尋片段設計的指令,如今在 Google 與 Bing 的官方文件裡都直接綁定 AI 引用(AI Overviews/AI Mode/Copilot)——舊指令長出了新殺傷力。正確策略是預設全開、只對少數例外精準上鎖,並認清一件事:這些鎖對 ChatGPT、Claude、Perplexity 目前完全無效,片段層級的控制權只存在於 Google 與 Bing 的世界。


這組指令 2019 年出生,2025 年才長出 AI 殺傷力

先講清楚時間線,你才知道為什麼老網站特別容易中招。

Google 在 2019 年 9 月 24 日推出 max-snippetdata-nosnippet 等一組片段控制指令。時間點與歐盟著作權指令(法國率先立法,要求平台就新聞片段付費或取得授權)幾乎重疊,外界普遍解讀兩者相關——但 Google 官方公告本身沒有提到任何法案,這層因果是媒體的解讀,不是官方說法。當時這組指令管的東西很單純:搜尋結果頁上那兩三行灰色預覽文字。

轉折發生在 AI 搜尋成為主戰場之後。Google 的 robots meta tag 官方文件現在白紙黑字寫著:nosnippet 適用於「web search、Google Images、Discover、AI Overviews、AI Mode」全部形態,並且會阻止內容被當作 AI Overviews 與 AI Mode 的直接輸入max-snippet 也有幾乎相同的敘述。同一份 AI features 文件還有一句更關鍵的話:想成為 AI Overviews 或 AI Mode 的引用來源,頁面必須「可被索引、且有資格以片段形式出現在搜尋結果」——片段資格就是 AI 引用資格,兩者綁死。

Bing 走得更直白。2020 年 4 月起支援 max-snippetnosnippet,2025 年 10 月正式加入 data-nosnippet,官方公告明講這個屬性同時控制「搜尋結果與 Copilot 的 AI 生成答案」。

一個常見誤解要在這裡拆掉:Google-Extended 跟這件事無關。它是獨立的爬蟲 token,管的是內容能否用於 Gemini 模型訓練與 Vertex AI 的 grounding;Google 官方文件明講它不影響搜尋收錄、也不是排名訊號,全文從頭到尾沒提 AI Overviews。想控制 AI Overviews 引用,用的是 snippet 指令這條線;想擋 Gemini 訓練,才是 Google-Extended 那條線。兩條線混著設,就會出現「擋了訓練卻沒擋到引用」或反過來的錯置——這在8 大 AI 爬蟲規則那篇拆過的分層裡,是最容易接錯線的一段。


四個指令,各自的語法陷阱

指令 層級 作用 最容易踩的坑
nosnippet(meta robots) 整頁 不顯示任何文字預覽,同時退出 AI Overviews/AI Mode 引用輸入 外掛全域套用,一行毀全站
max-snippet:[N](meta robots) 整頁 片段長度上限 N 字元;0 等同 nosnippet;-1 交給 Google 決定 0 當「預設值」寫上去
data-nosnippet(HTML 屬性) 頁內片段 該元素內容不出現在片段與 AI 引用輸入 只能用在 spandivsection;蓋到版型容器等於鎖整頁
noarchive(meta robots) 整頁 對 Google 已無作用(快取功能 2024 年退役,指令已列入棄用清單);Bing 仍支援 當成「防 AI」在用——它從來不管這個

三個規格細節,深度使用前必須知道:

data-nosnippet 是 boolean 屬性。寫 data-nosnippet="false" 不會關閉它——值會被忽略,只要屬性存在就生效。想解除只有一條路:把屬性整個拿掉。

未閉合的 <div> 會把封鎖範圍吃到頁尾。Google 文件明確警告:data-nosnippet 掛在沒有正確關閉的元素上,封鎖範圍會一路延伸到解析器認定的邊界。範本改版時多刪一個 </div>,可引用範圍就無聲地歸零——這種事故不會有任何錯誤訊息。

多指令衝突時,最嚴格的生效max-snippet:50nosnippet 同時存在,結果是 nosnippet。這代表清查時不能「看到一個好的就放心」,要把整頁所有 robots 指令收齊再判定。


控制邊界:你的鎖對誰有效

這是全文最重要的一張表。片段控制指令不是通用協定,每道鎖的有效範圍差很多:

引擎/產品 站台層(robots.txt) 整頁層(meta robots) 片段層(data-nosnippet)
Google 搜尋+AI Overviews/AI Mode 支援 支援,官方明講約束 AI 引用 支援,同左
Bing 搜尋+Copilot 支援 2020 年起支援 2025 年 10 月起支援,官方明講管 Copilot
ChatGPT(OpenAI 系爬蟲) 支援 僅 noindex 類二元開關(X-Robots-Tag) 官方文件查無
Claude 系爬蟲 支援 官方文件查無 官方文件查無
Perplexity 支援 官方文件查無 官方文件查無

查遍 OpenAI、Anthropic、Perplexity 三家的官方爬蟲文件,目前都只提供整站或路徑層級的 robots.txt 控制。也就是說:想擋 ChatGPT 或 Perplexity 引用你頁面裡的某一段文字,現階段沒有任何官方機制做得到——只能整頁擋或整頁放。附帶一提,連 robots.txt 這層都不是鐵板:Cloudflare 在 2025 年 8 月曾公開指出 Perplexity 使用未申報的爬蟲規避網站的封鎖設定,控制與現實之間有落差。

標準化的解法在路上但還沒到。IETF 的 aipref 工作組正在制定 robots.txt 層的 AI 使用偏好標準(searchai-inputai-train 三分類,Cloudflare 推的 Content Signals 與其相容,細節見Content-Signal 那篇)。但兩件事要認清:它的顆粒度是站台或路徑層級,鎖不到頁內片段;而且它還在草案階段——Google 搜尋團隊的工程師公開說過,這類 robots.txt 訊號現階段「對任何爬蟲都沒有實際約束力」。把它當未來式追蹤可以,當現在式依賴不行。

所以片段控制的實際棋盤是:Google 與 Bing 給你三層顆粒度,其他引擎只有整頁開關。策略要按這個現實設計,下面五個檢查點就是照這個順序排的。


檢查點 1:整頁級自殘指令歸零

檢查內容

  • <meta name="robots"> 與 HTTP 回應的 X-Robots-Tag 裡有沒有 nosnippetnoindexmax-snippet:0
  • 不只看首頁——每個頁面範本(文章頁、產品頁、分類頁)各抽一頁查
curl -s https://你的網域/ | grep -io '<meta[^>]*robots[^>]*>'
curl -sI https://你的網域/ | grep -i 'x-robots-tag'

為什麼重要

這一類指令是整個維度裡唯一的「一票否決」:noindex 讓頁面連索引都進不了,nosnippet 讓頁面留在索引裡但退出引用池。其他 11 個維度做得再好,這裡有一行就全部歸零。

常見錯誤

  • SEO 外掛的「防止內容被盜用」選項,背後就是全域 nosnippet
  • staging 環境的 noindex 隨部署帶上正式站
  • meta 標籤由 JS 注入——原始 HTML 乾淨,rendered DOM 才看得到問題,所以清查要看兩層

檢查點 2:data-nosnippet 的落點

檢查內容

  • 每個 data-nosnippet 元素落在哪:是精準的一小段,還是 <main><article>、或 class 名稱帶 content/wrapper/container 的版型容器
  • 有沒有蓋到 FAQ、定義、詞彙表這類最該被引用的區塊
  • 總數是否多到失控(幾十個散落全站,通常代表沒人在管)

瀏覽器 Console 一行就能盤點:

document.querySelectorAll('[data-nosnippet]').forEach(el => console.log(el.tagName, el.className, el.textContent.slice(0, 40)))

為什麼重要

data-nosnippet 的價值就在顆粒度——它是唯一能做到「這頁可以引用,但這一段不行」的工具。把它掛到版型容器上,顆粒度優勢直接變成整頁封鎖,比 meta nosnippet 更糟的是它藏在 HTML 深處,比 meta 標籤更難被發現

常見錯誤

  • 前端工程師把 data-nosnippet 當一般 data 屬性複製貼上,隨元件散播全站
  • 蓋到 FAQ 區——等於親手把可引用性最高的內容鎖起來
  • 未閉合 div 讓封鎖範圍外溢(前一節講過,這裡是它實際發作的地方)

檢查點 3:該鎖的才鎖

檢查內容

先確認方向:預設是全開,上鎖是例外。然後對照兩張清單。

絕不上鎖(這些是你被 AI 引用的本錢):

  • FAQ、定義、答案段落——AI 願意搬走的段落全在這裡
  • 產品規格、價格、方案內容——鎖了它,AI 只能拿第三方的過時版本描述你
  • 品牌事實:地址、成立年份、認證資訊——這是 AI 描述你時的對錯之分

值得考慮上鎖

  • 斷章取義風險高的段落:法律免責、醫療警語——被截到一半時語義可能反轉的內容
  • 強時效內容:限時價格、活動檔期——過期後被 AI 引用等於散播錯誤資訊
  • 頁面雜訊:cookie 聲明、廣告合作文案——避免 AI 把這些當成「你的內容」摘要出去

為什麼重要

每上一道鎖都在縮小可引用面。片段控制的目的從來是「控制品質」——確保 AI 拿到的是你想被轉述的內容,而非「防止使用」。

付費牆內容值得單獨講:把牆後內容用 data-nosnippet 全鎖,保護了內容資產,也同時放棄了這些內容為你賺引用的機會。比較健康的切法跟寫作層的原則一致——結論做成可引用的公開段落,推導細節留在牆後。讓 AI 引用你的結論、讓讀者為過程付費,兩頭都拿到。

常見錯誤

  • 用「競品會抄」當理由鎖產品規格——競品抄不抄跟這個指令無關,AI 引用不了你倒是真的
  • 鎖了價格頁又希望 AI 推薦時報價正確——訊息源被你自己關了

檢查點 4:max-snippet 的正確答案通常是不設

檢查內容

  • 現值是多少:沒設、-1、還是某個具體數字
  • 若是具體數字:這個上限是誰、基於什麼理由設的?答不出來就是待清理項

為什麼重要

max-snippet 的三個值差異巨大:0 等同 nosnippet(一票否決);-1 與不設都是把長度交給引擎決定;中間的具體數字則是「部分限制」——Google 文件提到這會限制內容作為 AI 引用輸入的量。對絕大多數想被 AI 引用的網站,正確答案就是不設或 -1:你希望引擎拿到完整段落去生成答案,而非被腰斬的半句話。具體數字的合理場景很少,多半是新聞授權談判這類特殊情境。

另外有一條官方但書值得知道:若內容另透過結構化資料或授權合約提供給 Google,max-snippet 的限制不適用於那些管道——指令管的是「從頁面抽片段」這條路,不是所有路。

常見錯誤

  • 從別站抄 meta 範本,把人家情境下的 max-snippet:160 一起抄回來
  • 想「引導」AI 只引用開頭而設短上限——引擎不保證截斷點,結果常是語義破碎的片段,反而降低被選用的機率

檢查點 5:邊界認知與維運節奏

檢查內容

  • 團隊是否清楚:片段級控制只對 Google/Bing 生效,對 ChatGPT/Claude/Perplexity 只有整頁級的 robots.txt(分層設定看這篇
  • 範本改版、外掛更新、SEO 廠商交接後,有沒有回歸檢查機制
  • 是否有人追蹤 aipref/Content Signals 的標準化進度(追蹤即可,先別依賴)

為什麼重要

片段控制的事故幾乎都不是「設計錯」而是「壞掉沒人知道」:指令沒有任何可見的錯誤訊息,壞了之後網站看起來一切正常,只有引用悄悄消失。它需要的是低頻但固定的巡檢——每次範本層變更後查一輪,比每天盯著更有用。

常見錯誤

  • 把 Google-Extended 當 AI Overviews 開關(前面拆過,兩條不同的線)
  • 換了 SEO 廠商,沒人交接「當年為什麼鎖這幾段」,新團隊不敢動也不敢刪
  • 用一次性健檢代替回歸檢查——指令是活的,檢查也得是

健檢報告會看到什麼

geoweb.tw 健檢的「片段控制策略」維度(權重 4%)實際檢查四組訊號:

  • data-nosnippet數量與落點:蓋到頁面級容器判定過度封鎖;元素數量過多會給提醒
  • meta robots 指令:nosnippetnoindex 直接不及格;偵測到 max-snippet 視為刻意的精細控制
  • 可引用內容的可見性:FAQ、定義、詞彙表結構有沒有被 data-nosnippet 蓋到——被蓋重扣,確認未封鎖加分;整頁找不到可引用結構時另給建議
  • 整體策略判定:「什麼都沒設」拿的是中性分不是高分——因為訊號上無法區分「刻意全開」與「沒人管」,策略分要靠「有可引用內容、且確認沒被誤鎖」掙回來

權重 4% 看起來輕,但這一維的意義是保險絲:它不及格時,通常代表有一行指令正在讓其他維度的努力打折。

👉 免費 GEO 健檢——兩分鐘看到你的網站有沒有正在自殘的片段指令。

清查出來的歷史指令要不要拆、拆的順序、以及範本層的回歸檢查怎麼進 CI,牽涉每個站的 CMS 與部署流程,這是我們託管服務的日常工作之一:[email protected]


GEO 深度技術專題系列。延伸閱讀:12 維度總覽內容可引用性設計8 大 AI 爬蟲規則差異與最佳設定