在瀏覽器打開你的網站,按 Ctrl+U 看原始碼,搜尋 nosnippet。如果找到一行 <meta name="robots" content="nosnippet">,你就找到了整站 GEO 最貴的一行字:照 Google 現行官方文件,這行指令除了拿掉搜尋結果的文字預覽,也同時把你的內容從 AI Overviews 與 AI Mode 的引用輸入裡拿掉。
而有這行的網站,多半不記得它是誰加的——常見來源是多年前某任 SEO 顧問防內容農場抄襲的手筆,或某個 SEO 外掛的全域設定。指令還在,當年的理由早就不在了。
TL;DR
片段控制是 12 維度裡的「防呆維度」:多數網站的問題是亂擋而非沒擋。nosnippet/max-snippet/data-nosnippet 這組 2019 年為搜尋片段設計的指令,如今在 Google 與 Bing 的官方文件裡都直接綁定 AI 引用(AI Overviews/AI Mode/Copilot)——舊指令長出了新殺傷力。正確策略是預設全開、只對少數例外精準上鎖,並認清一件事:這些鎖對 ChatGPT、Claude、Perplexity 目前完全無效,片段層級的控制權只存在於 Google 與 Bing 的世界。
這組指令 2019 年出生,2025 年才長出 AI 殺傷力
先講清楚時間線,你才知道為什麼老網站特別容易中招。
Google 在 2019 年 9 月 24 日推出 max-snippet、data-nosnippet 等一組片段控制指令。時間點與歐盟著作權指令(法國率先立法,要求平台就新聞片段付費或取得授權)幾乎重疊,外界普遍解讀兩者相關——但 Google 官方公告本身沒有提到任何法案,這層因果是媒體的解讀,不是官方說法。當時這組指令管的東西很單純:搜尋結果頁上那兩三行灰色預覽文字。
轉折發生在 AI 搜尋成為主戰場之後。Google 的 robots meta tag 官方文件現在白紙黑字寫著:nosnippet 適用於「web search、Google Images、Discover、AI Overviews、AI Mode」全部形態,並且會阻止內容被當作 AI Overviews 與 AI Mode 的直接輸入;max-snippet 也有幾乎相同的敘述。同一份 AI features 文件還有一句更關鍵的話:想成為 AI Overviews 或 AI Mode 的引用來源,頁面必須「可被索引、且有資格以片段形式出現在搜尋結果」——片段資格就是 AI 引用資格,兩者綁死。
Bing 走得更直白。2020 年 4 月起支援 max-snippet 與 nosnippet,2025 年 10 月正式加入 data-nosnippet,官方公告明講這個屬性同時控制「搜尋結果與 Copilot 的 AI 生成答案」。
一個常見誤解要在這裡拆掉:Google-Extended 跟這件事無關。它是獨立的爬蟲 token,管的是內容能否用於 Gemini 模型訓練與 Vertex AI 的 grounding;Google 官方文件明講它不影響搜尋收錄、也不是排名訊號,全文從頭到尾沒提 AI Overviews。想控制 AI Overviews 引用,用的是 snippet 指令這條線;想擋 Gemini 訓練,才是 Google-Extended 那條線。兩條線混著設,就會出現「擋了訓練卻沒擋到引用」或反過來的錯置——這在8 大 AI 爬蟲規則那篇拆過的分層裡,是最容易接錯線的一段。
四個指令,各自的語法陷阱
| 指令 | 層級 | 作用 | 最容易踩的坑 |
|---|---|---|---|
nosnippet(meta robots) |
整頁 | 不顯示任何文字預覽,同時退出 AI Overviews/AI Mode 引用輸入 | 外掛全域套用,一行毀全站 |
max-snippet:[N](meta robots) |
整頁 | 片段長度上限 N 字元;0 等同 nosnippet;-1 交給 Google 決定 |
把 0 當「預設值」寫上去 |
data-nosnippet(HTML 屬性) |
頁內片段 | 該元素內容不出現在片段與 AI 引用輸入 | 只能用在 span/div/section;蓋到版型容器等於鎖整頁 |
noarchive(meta robots) |
整頁 | 對 Google 已無作用(快取功能 2024 年退役,指令已列入棄用清單);Bing 仍支援 | 當成「防 AI」在用——它從來不管這個 |
三個規格細節,深度使用前必須知道:
data-nosnippet 是 boolean 屬性。寫 data-nosnippet="false" 不會關閉它——值會被忽略,只要屬性存在就生效。想解除只有一條路:把屬性整個拿掉。
未閉合的 <div> 會把封鎖範圍吃到頁尾。Google 文件明確警告:data-nosnippet 掛在沒有正確關閉的元素上,封鎖範圍會一路延伸到解析器認定的邊界。範本改版時多刪一個 </div>,可引用範圍就無聲地歸零——這種事故不會有任何錯誤訊息。
多指令衝突時,最嚴格的生效。max-snippet:50 加 nosnippet 同時存在,結果是 nosnippet。這代表清查時不能「看到一個好的就放心」,要把整頁所有 robots 指令收齊再判定。
控制邊界:你的鎖對誰有效
這是全文最重要的一張表。片段控制指令不是通用協定,每道鎖的有效範圍差很多:
| 引擎/產品 | 站台層(robots.txt) | 整頁層(meta robots) | 片段層(data-nosnippet) |
|---|---|---|---|
| Google 搜尋+AI Overviews/AI Mode | 支援 | 支援,官方明講約束 AI 引用 | 支援,同左 |
| Bing 搜尋+Copilot | 支援 | 2020 年起支援 | 2025 年 10 月起支援,官方明講管 Copilot |
| ChatGPT(OpenAI 系爬蟲) | 支援 | 僅 noindex 類二元開關(X-Robots-Tag) | 官方文件查無 |
| Claude 系爬蟲 | 支援 | 官方文件查無 | 官方文件查無 |
| Perplexity | 支援 | 官方文件查無 | 官方文件查無 |
查遍 OpenAI、Anthropic、Perplexity 三家的官方爬蟲文件,目前都只提供整站或路徑層級的 robots.txt 控制。也就是說:想擋 ChatGPT 或 Perplexity 引用你頁面裡的某一段文字,現階段沒有任何官方機制做得到——只能整頁擋或整頁放。附帶一提,連 robots.txt 這層都不是鐵板:Cloudflare 在 2025 年 8 月曾公開指出 Perplexity 使用未申報的爬蟲規避網站的封鎖設定,控制與現實之間有落差。
標準化的解法在路上但還沒到。IETF 的 aipref 工作組正在制定 robots.txt 層的 AI 使用偏好標準(search/ai-input/ai-train 三分類,Cloudflare 推的 Content Signals 與其相容,細節見Content-Signal 那篇)。但兩件事要認清:它的顆粒度是站台或路徑層級,鎖不到頁內片段;而且它還在草案階段——Google 搜尋團隊的工程師公開說過,這類 robots.txt 訊號現階段「對任何爬蟲都沒有實際約束力」。把它當未來式追蹤可以,當現在式依賴不行。
所以片段控制的實際棋盤是:Google 與 Bing 給你三層顆粒度,其他引擎只有整頁開關。策略要按這個現實設計,下面五個檢查點就是照這個順序排的。
檢查點 1:整頁級自殘指令歸零
檢查內容
<meta name="robots">與 HTTP 回應的X-Robots-Tag裡有沒有nosnippet、noindex、max-snippet:0- 不只看首頁——每個頁面範本(文章頁、產品頁、分類頁)各抽一頁查
curl -s https://你的網域/ | grep -io '<meta[^>]*robots[^>]*>'
curl -sI https://你的網域/ | grep -i 'x-robots-tag'
為什麼重要
這一類指令是整個維度裡唯一的「一票否決」:noindex 讓頁面連索引都進不了,nosnippet 讓頁面留在索引裡但退出引用池。其他 11 個維度做得再好,這裡有一行就全部歸零。
常見錯誤
- SEO 外掛的「防止內容被盜用」選項,背後就是全域
nosnippet - staging 環境的
noindex隨部署帶上正式站 - meta 標籤由 JS 注入——原始 HTML 乾淨,rendered DOM 才看得到問題,所以清查要看兩層
檢查點 2:data-nosnippet 的落點
檢查內容
- 每個
data-nosnippet元素落在哪:是精準的一小段,還是<main>、<article>、或 class 名稱帶 content/wrapper/container 的版型容器 - 有沒有蓋到 FAQ、定義、詞彙表這類最該被引用的區塊
- 總數是否多到失控(幾十個散落全站,通常代表沒人在管)
瀏覽器 Console 一行就能盤點:
document.querySelectorAll('[data-nosnippet]').forEach(el => console.log(el.tagName, el.className, el.textContent.slice(0, 40)))
為什麼重要
data-nosnippet 的價值就在顆粒度——它是唯一能做到「這頁可以引用,但這一段不行」的工具。把它掛到版型容器上,顆粒度優勢直接變成整頁封鎖,比 meta nosnippet 更糟的是它藏在 HTML 深處,比 meta 標籤更難被發現。
常見錯誤
- 前端工程師把
data-nosnippet當一般 data 屬性複製貼上,隨元件散播全站 - 蓋到 FAQ 區——等於親手把可引用性最高的內容鎖起來
- 未閉合 div 讓封鎖範圍外溢(前一節講過,這裡是它實際發作的地方)
檢查點 3:該鎖的才鎖
檢查內容
先確認方向:預設是全開,上鎖是例外。然後對照兩張清單。
絕不上鎖(這些是你被 AI 引用的本錢):
- FAQ、定義、答案段落——AI 願意搬走的段落全在這裡
- 產品規格、價格、方案內容——鎖了它,AI 只能拿第三方的過時版本描述你
- 品牌事實:地址、成立年份、認證資訊——這是 AI 描述你時的對錯之分
值得考慮上鎖:
- 斷章取義風險高的段落:法律免責、醫療警語——被截到一半時語義可能反轉的內容
- 強時效內容:限時價格、活動檔期——過期後被 AI 引用等於散播錯誤資訊
- 頁面雜訊:cookie 聲明、廣告合作文案——避免 AI 把這些當成「你的內容」摘要出去
為什麼重要
每上一道鎖都在縮小可引用面。片段控制的目的從來是「控制品質」——確保 AI 拿到的是你想被轉述的內容,而非「防止使用」。
付費牆內容值得單獨講:把牆後內容用 data-nosnippet 全鎖,保護了內容資產,也同時放棄了這些內容為你賺引用的機會。比較健康的切法跟寫作層的原則一致——結論做成可引用的公開段落,推導細節留在牆後。讓 AI 引用你的結論、讓讀者為過程付費,兩頭都拿到。
常見錯誤
- 用「競品會抄」當理由鎖產品規格——競品抄不抄跟這個指令無關,AI 引用不了你倒是真的
- 鎖了價格頁又希望 AI 推薦時報價正確——訊息源被你自己關了
檢查點 4:max-snippet 的正確答案通常是不設
檢查內容
- 現值是多少:沒設、
-1、還是某個具體數字 - 若是具體數字:這個上限是誰、基於什麼理由設的?答不出來就是待清理項
為什麼重要
max-snippet 的三個值差異巨大:0 等同 nosnippet(一票否決);-1 與不設都是把長度交給引擎決定;中間的具體數字則是「部分限制」——Google 文件提到這會限制內容作為 AI 引用輸入的量。對絕大多數想被 AI 引用的網站,正確答案就是不設或 -1:你希望引擎拿到完整段落去生成答案,而非被腰斬的半句話。具體數字的合理場景很少,多半是新聞授權談判這類特殊情境。
另外有一條官方但書值得知道:若內容另透過結構化資料或授權合約提供給 Google,max-snippet 的限制不適用於那些管道——指令管的是「從頁面抽片段」這條路,不是所有路。
常見錯誤
- 從別站抄 meta 範本,把人家情境下的
max-snippet:160一起抄回來 - 想「引導」AI 只引用開頭而設短上限——引擎不保證截斷點,結果常是語義破碎的片段,反而降低被選用的機率
檢查點 5:邊界認知與維運節奏
檢查內容
- 團隊是否清楚:片段級控制只對 Google/Bing 生效,對 ChatGPT/Claude/Perplexity 只有整頁級的 robots.txt(分層設定看這篇)
- 範本改版、外掛更新、SEO 廠商交接後,有沒有回歸檢查機制
- 是否有人追蹤 aipref/Content Signals 的標準化進度(追蹤即可,先別依賴)
為什麼重要
片段控制的事故幾乎都不是「設計錯」而是「壞掉沒人知道」:指令沒有任何可見的錯誤訊息,壞了之後網站看起來一切正常,只有引用悄悄消失。它需要的是低頻但固定的巡檢——每次範本層變更後查一輪,比每天盯著更有用。
常見錯誤
- 把 Google-Extended 當 AI Overviews 開關(前面拆過,兩條不同的線)
- 換了 SEO 廠商,沒人交接「當年為什麼鎖這幾段」,新團隊不敢動也不敢刪
- 用一次性健檢代替回歸檢查——指令是活的,檢查也得是
健檢報告會看到什麼
geoweb.tw 健檢的「片段控制策略」維度(權重 4%)實際檢查四組訊號:
data-nosnippet的數量與落點:蓋到頁面級容器判定過度封鎖;元素數量過多會給提醒meta robots指令:nosnippet/noindex直接不及格;偵測到max-snippet視為刻意的精細控制- 可引用內容的可見性:FAQ、定義、詞彙表結構有沒有被
data-nosnippet蓋到——被蓋重扣,確認未封鎖加分;整頁找不到可引用結構時另給建議 - 整體策略判定:「什麼都沒設」拿的是中性分不是高分——因為訊號上無法區分「刻意全開」與「沒人管」,策略分要靠「有可引用內容、且確認沒被誤鎖」掙回來
權重 4% 看起來輕,但這一維的意義是保險絲:它不及格時,通常代表有一行指令正在讓其他維度的努力打折。
👉 免費 GEO 健檢——兩分鐘看到你的網站有沒有正在自殘的片段指令。
清查出來的歷史指令要不要拆、拆的順序、以及範本層的回歸檢查怎麼進 CI,牽涉每個站的 CMS 與部署流程,這是我們託管服務的日常工作之一:[email protected]
GEO 深度技術專題系列。延伸閱讀:12 維度總覽、內容可引用性設計、8 大 AI 爬蟲規則差異與最佳設定