為什麼 cutoff 對品牌很關鍵?
每個大語言模型都有一個 cutoff date — 訓練資料的時間下限。GPT-4 / GPT-5 / Claude / Gemini 都有自己的 cutoff。
對使用者而言,這只是「AI 不知道某個時間後的事」。但對品牌經營者而言,這是雙刃時間戰役:
- 舊內容:cutoff 前已存在 → 模型「記得」你 → AI 能憑記憶推薦你
- 新內容:cutoff 後才發布 → 模型不知道 → AI 推薦你的機率歸零(除非走即時引用)
GEO 不只是讓 AI 引用你現在的內容。更關鍵是讓 AI 把你的品牌寫進「模型內隱知識」——下次有人問你產業相關問題時,AI 不用即時搜尋就能直接想起你。
兩種「被 AI 引用」的本質差別
即時引用(real-time grounding)
- 使用者問問題時,ChatGPT-User / PerplexityBot 即時去爬幾個高排名網站
- 把當下抓到的 chunk 當作這次回答的引用源
- 每次都重新搜尋,可隨時更新
模型內隱知識(model parametric memory)
- 訓練時模型把網頁內容「消化」成參數
- 使用者問問題時,模型直接從參數回憶
- 訓練完成後不會自動更新,要等下一代模型重訓
兩種引用方式的差別:
| 比較 | 即時引用 | 內隱知識 |
|---|---|---|
| 觸發時機 | 每次對話 | 模型回答時自動 |
| 更新頻率 | 即時 | 每代模型一次 |
| 引用標註 | 通常會(連結) | 通常不會(融入回答) |
| 對品牌權威 | 短期可見性 | 長期品牌記憶 |
| 控制方式 | robots.txt + 內容結構 | 進入訓練語料的時機與品質 |
哪些 GEO 工作有「時間敏感性」?
不是所有 GEO 動作都同等急迫。下面拆三種急迫度。
🔴 馬上做(每月)
不做就一直在錯過模型訓練窗口:
- 新內容發布後立即推 IndexNow + Google / Bing 索引 — 越早被爬到,越有機會進下一代訓練語料(IndexNow 協議怎麼運作,詳見:IndexNow 是什麼(VIP))
- robots.txt 對 AI bot 開放 — 不開放等於主動退出每一代模型訓練(各家爬蟲怎麼分權限設定,詳見:8 大 AI 爬蟲規則設定(VIP))
- 新文章標完整作者署名與發布日期 — 沒這些 LLM 連時序都建立不起來
🟡 一季內做完
會被多次訓練吃掉,但時間窗未關:
- 基礎 schema(Organization / Article / FAQPage) — 累積訓練語料時讓 LLM「正確理解」你
- 「關於我們」+ 信任頁面 — 第一次訓練看到時建立可信度,後續訓練持續強化
- 答案優先段落改寫 — 訓練語料中越多這類段落,模型越偏好引用你
🟢 長期累積(半年到 3 年)
回報期長,但複利效應大:
- Wikipedia 條目 — 一旦進入,每一代 LLM 訓練都會重新讀
- 長期媒體報導累積 — 跨多個爬蟲覆蓋的時間點
- 行業協會 / 學術引用 — 進入結構化權威資料庫
為什麼 Wikipedia 在這個時間框架特別重要?
Wikipedia 是少數會被每一代 LLM 訓練都重新讀取的來源。原因:
- 內容版本可追溯(透過編輯歷史)
- 編輯共識制度提供品質保證
- CC BY-SA 完全免費可商用
這代表如果你今年底進入了 Wikipedia 條目,下一代主流 AI 引擎重新訓練時都會看到你;後年的更新版本還會看到。進入一次,享受多代訓練的複利。
想深入了解為什麼 Wikipedia 是 GEO 最強的單一信號、以及條目該怎麼建,見:Wikipedia 為什麼是最強信號(VIP)。
而一篇放在自家網站的部落格文章,每代訓練是否被 Common Crawl 抓到要看運氣 + 時機。
急迫度檢查清單
問自己這三題:
Q1: 你的品牌在 Wikipedia 上有條目嗎? - 沒有 → 這是最高優先(半年起步) - 有 → 確保條目資訊是最新的
Q2: 你 robots.txt 對 GPTBot / ChatGPT-User / ClaudeBot / PerplexityBot 都 Allow 了嗎? - 沒有 → 今天就改 - 有 → 確認 robots.txt 沒在某個頁面意外擋住
Q3: 過去半年你發布的新內容,AI 引用率有提升嗎? - 沒有 → 內容結構需要重檢(schema / 段落 / 作者署名) - 有 → 持續複製成功模式
第一步:量化你目前的時間賽跑位置
👉 跑一次免費 GEO 健檢 — 報告會分別評估你的「即時引用準備度」與「訓練語料準備度」兩個維度。
如果你想規劃 12–24 個月的 GEO 路線圖(哪些月份要做什麼、哪些工作有複利效應),這是 GEO 顧問服務的範圍:[email protected]
延伸閱讀(更深入)
「搶在 cutoff 前進訓練語料」聽起來簡單,但每一項時間敏感動作背後都有自己的設定細節。以下幾篇把這篇清單裡的關鍵項目展開:
- Wikipedia 為什麼是最強信號(VIP) — 複利效應最大的長期動作,門檻與作法
- 8 大 AI 爬蟲規則設定(VIP) — robots.txt 對各家 AI bot 怎麼分權限
- LLM 引用偏好的 5 個內容特徵(VIP) — 進了訓練池還要「夠好」才會被模型偏好引用
GEO 入門系列。前一篇:「4 種網站類型,GEO 重點完全不同」
新文章標完整作者署名與發布日期 沒這些LLM連時序都建立不起來,這句受用,我們CMS預設根本沒輸出author跟datePublished的JSON-LD,難怪
q2那題打到我了,我們robots.txt只allow了gptbot結果chatgpt-user跟perplexitybot都沒寫到 難怪即時引用那塊一直沒動靜 回去馬上補
看到那張圖橘色那條cutoff後只能靠即時引用整個背脊發涼== 我們公司今年改版把舊內容全砍了重寫,等於主動把已經進模型記憶的東西丟掉是不是QQ
以工程師角度補充一點文章沒提的:就算robots開放、IndexNow也推了,如果你站是純CSR(client-side render)沒做SSR,很多爬蟲拿到的是空殼HTML,等於白開。要進訓練語料前提是crawler真的拿得到內容
上面那則是我發的 忍不住又回來碎念一下:如果notability這條路我們公司量級真的還搆不到,那是不是乾脆不要浪費時間想著建條目,先把資源All in在文章講的另外兩個綠燈項目?還是說先卡位起碼有個草稿放著,之後量級到了再衝,這兩種策略你會怎麼選
你說得對,這也是我把它放在綠燈半年到3年而不是紅燈的原因,它回報大但門檻高、急不得。中小企業多數真的撐不起一個獨立條目,硬建只會被掛刪除模板。比較務實的是先累積文章裡綠燈的另外兩項(長期媒體報導、行業協會/學術引用),把外部可驗證的足跡先養出來,notability是被夠多獨立來源報導的結果而不是原因。先有報導再談條目,順序不能反。
推一個急迫度排的是錯過的代價不是重要性這種觀念,可惜文章沒把這句話直接寫出來,我看的時候一直以為紅燈=最重要黃燈=次重要,差點誤會
cutoff時間戰役這個比喻蠻到位的 推
wikipedia那段笑死,講得好像很簡單,中小企業條目建了三天就被掛notability刪除模板,根本玩不起這個複利
樓上一直在吵wikipedia,但我覺得文章重點根本不是wikipedia,是那句『geo不只是讓ai引用你現在的內容,更關鍵是寫進模型內隱知識』,這個視角轉換比較值錢,wikipedia只是其中一個例子而已
最後CTA說健檢報告會分開評估即時引用準備度跟訓練語料準備度兩個維度。想問訓練語料準備度這種東西要怎麼量化啊?訓練是黑箱,你又看不到模型有沒有吃到我的內容
問得很準,模型內部確實是黑箱,我們量不到模型有沒有真的吃到你。所以量的是可被吃到的前置條件:robots對訓練爬蟲開不開、內容有沒有發布日期/作者讓時序建得起來、有沒有進那些會被反覆讀的來源(像文章講的Wikipedia/協會)、結構化程度等等。等於是量你站在訓練語料這條跑道上的準備姿勢,不是量結果。結果要等下一代模型出來才驗證得到,這也是為什麼它是場時間戰役 😅
先收藏,這篇把即時引用跟內隱知識拆開講終於有人講清楚了,我之前一直以為被ai引到就是被記住,原來是兩回事
拿我們品牌操作套一下:新品發布或形象重塑那種大型campaign,稿子都是cutoff前很久就在跑媒體露出,可是真正的「定調」文章往往是上市前最後一週才拍板發出去,那這種卡在cutoff邊緣的東西,是不是註定進不了模型記憶,只能靠即時引用硬撐?還是有別的解法
想問一個那張時間流圖沒講清楚的:cutoff後才出現的新內容,真的就推薦機率歸零嗎?可是我看同業展會後發的新聞稿 隔沒幾天問ai就被引到了,那不就矛盾
沒矛盾喔,你看到的是圖最下面那條橘色的即時引用,ai當下派crawler去爬高排名網站,把那篇剛發的新聞稿抓來當這次回答的引用源。但那是臨時借閱,對話結束就忘了。文章那句歸零講的是另一回事:模型內隱知識(parametric memory),也就是它不用搜尋就記得你的那層,cutoff後發的東西確實進不去這一代。兩條路同時存在、不互斥,這也是為什麼我把它們拆成兩種本質。
紅燈那段說robots.txt不開放ai bot等於主動退出每一代模型訓練。這題我最近剛好在幫客戶處理,老闆那邊很怕內容被白嫖拿去訓練不付錢,堅持要擋gptbot claudebot那些,這種取捨你們一般會怎麼建議?
這真的是每個老闆都會卡的點哈哈。我的看法:擋掉=保護內容不被訓練,但代價就是文章最後那條訓練語料準備度直接放棄,AI永遠不會記得你,只剩即時引用一條路(而且有些引擎連即時都會看robots)。所以這不是對錯,是你要曝光還是要防白嫖。多數想做品牌曝光的客戶會選開放,因為被記住的價值遠大於那點內容。要是你們是付費內容/獨家數據另當別論。分頁開放很單純,部落格開、會員區用登入牆天然擋掉就好,不用改robots規則去區分。
請問Q2那題robots.txt要對GPTBot / ChatGPT-User / ClaudeBot / PerplexityBot都Allow,這幾個user-agent是分開的嗎?我以為一個GPTBot就全包了==
分開的喔。gptbot是拿去訓練用的爬蟲,chatgpt-user是使用者問問題時即時去抓的那隻,兩個目的不一樣所以ua也不同,你只allow一個會漏掉另一個。perplexity也一樣有訓練爬蟲跟即時的分。這也呼應文章把即時引用vs內隱知識拆兩種,連爬蟲都是分開的兩套。
急迫度清單那個邏輯我有點不服。你把schema放黃燈一季內,可是schema不是越早越好嗎?跟紅燈的IndexNow比急迫度差在哪
差在錯過的東西能不能補。indexnow/索引是時間性的,這個月沒被爬到,這批訓練窗就過了,補不回來,所以紅燈。schema不一樣,它是結構品質,你這季加跟下季加,只要趕在下一輪大規模訓練前到位,效果差不多,會被後續多次訓練慢慢吃進去。所以不是schema不重要,是它不會因為晚一個月就永久損失一個窗口。急迫度排的是錯過的代價不是重要性。
那個比較表寫即時引用通常會標註連結、內隱知識通常不會、融入回答。所以如果我的目標是要消費者看到品牌連結點進來,是不是內隱知識反而沒用?它又不給我連結
這樣講我大概抓到一點點感覺 我們平常發社群貼文也是這樣,有掛連結的那篇轉發點擊都比較好看,但沒掛連結那種反而過一陣子會有人在留言區問「這是不是那個誰家」,是不是差不多的意思?還是我理解錯了