假設你賣實木餐桌。你盯著一題:客戶問 AI「台北哪裡買得到實木餐桌」時,會不會推薦你。於是你把那個產品頁改了——補上規格表、寫清楚材質與產地、把小標改成客戶會問的句子。你用訪客視窗連問十次,從兩次提到你,變成八次。你截圖,你放心了。

然後你沒做那件真正該做的事:回頭問「小坪數餐桌怎麼選」「客廳傢俱推薦」「北歐風餐桌」——那些你上個月本來就會被順帶提到的題。如果你去問了,你會發現有幾題悄悄掉了。

你以為你在優化,其實你在搬運。這篇要講的,就是這張你看不見的帳單。

有人真的把這件事量了出來

大部分人做 GEO 的方式,是「一次瞄準一個查詢」:想被問到 X 時出現,就去改那個跟 X 有關的頁面。這聽起來天經地義,直到有一份論文把它拆開來量。

IF-GEO(arXiv:2601.13938,主要測於 GPT-4o-mini,並在 Gemini-2.0-Flash 上做了跨模型驗證)指出一件被多數 GEO 研究忽略的事實:一份內容從來不是只服務一個查詢,它同時被好幾個不同的問題檢索。於是研究者做了一個乾淨的診斷實驗——針對「單一查詢」優化一份文件,然後分別量兩種查詢的能見度變化:你瞄準的那個「目標查詢」,以及同一份內容也該服務、但你沒瞄準的「非目標查詢」。

目標查詢(你瞄準的) 非目標查詢(你沒瞄準的)
平均能見度提升 +0.277 +0.087
出現負向結果的比例 12.4% 30.6%

目標查詢的漲幅是非目標查詢的三倍多。但更刺眼的是下面那一列:你瞄準的那題,每八次優化裡約有一次讓它變差;你沒瞄準的那些,每三次就有一次變差。論文給這個現象一個名字——收益分配失衡。翻成白話:單一查詢優化很多時候不是把餅做大,是把餅從這邊挪到那邊,而被挪走的那邊,你根本沒在看。

這不是紙上推論,是實測出來的分配結果。它之所以一直沒被大多數人察覺,原因很簡單:你量的永遠是你瞄準的那一題,而那一題的數字,一定是好看的。

為什麼會這樣:同一份內容,服務的是互相打架的需求

道理其實不難。同一份內容要同時服務的那些查詢,對「這頁該長什麼樣」的要求常常是衝突的。

「實木餐桌」這種意圖明確的查詢,愛的是規格、材質、尺寸、產地——你把內容改得又硬又密,正中它下懷。但「小坪數傢俱怎麼選」要的是取捨建議、情境化的說明、幫我判斷的口吻;你為了前者把頁面塞滿規格,等於把後者要的東西擠了出去。你不是沒優化,你是替 A 查詢優化的同時,替 B 查詢反優化了。

這不是某一篇論文的孤例。RAID G-SEO(arXiv:2508.11158,測於開源模型 GLM-4-9B-0414)在自己的框架裡就白紙黑字寫下這個取捨:過度精確地針對單一查詢的意圖建模,會讓內容過度貼合那一個查詢,反而降低對其他查詢的泛化能力。精確與泛化,是蹺蹺板的兩端——你把一端壓到底,另一端就翹起來。

所以「盯著一題把它做上去」這個動作,內建了一筆代價。而這筆代價預設是隱形的,因為你的量測範圍,剛好只框住你想看到成功的那一題。

「那我每一題都做很多輪」也救不了

有人的第一反應是:那我不要只做一題,我每一題都盯、每一題都反覆優化很多輪,不就補起來了?

這條路也有天花板,而且撞到天花板之後會反傷。MAGEO(arXiv:2604.19516,測於 GPT-5.2、Gemini-3 Pro、Qwen-3 Max)觀察到一個叫「過度優化疲勞」的現象:能見度分數會在第五輪迭代前後到達高峰,之後不但不再上升,甚至開始輕微拉低內容的忠實度。他們給的建議是動態地提前喊停。

翻成白話:優化不是越用力越好,它有一個報酬遞減、甚至由正轉負的臨界點。所以「每一題都往死裡做」不是解方——它只是把單點優化的病,忠實地複製到每一個點上,還多附贈一個內容失真的風險。

對的做法:先看全局,再決定改哪裡

反過來說,什麼樣的做法能避開這張帳單?IF-GEO 給的方向,剛好是單點優化永遠不會做的那一步:先發散,再收斂

先把這份內容該服務的多個代表性查詢一次找齊,各自算出它們想要的修改方向,然後做那件關鍵的事——把這些互相衝突的要求擺在一起,找一個對「全體查詢」最好的統一改法,而不是對「某一個查詢」最好的改法。它連驗收指標都換掉了:單點優化看的是「目標查詢漲了多少」,而 IF-GEO 盯的是三個跟全局有關的數字——最差情境下你能爛到什麼程度、你往下掉的風險有多大、以及你在多少比例的查詢上是贏或至少打平。

這裡有個關於「到底要看幾題」的實際參考值:論文發現納入考量的查詢數越多,整體效果越好,但大約到第五題之後,邊際效益開始遞減。也就是說,多查詢視角不必無限展開,但「只看一題」和「看五題」是兩個世界。

判決:單點優化是零和搬運,全局量測才是增量。 差別不在你多努力,在你有沒有在看全局。沒有一個橫跨多查詢的量測基線,你連自己正在犧牲哪些查詢都不知道,更談不上判斷這個犧牲划不划算。

所以這件事為什麼難自己做

到這裡,反 DIY 的理由不是「技術太難」,而是「視野會騙你」。三個現實:

  1. 你得先知道一份內容該服務哪些查詢,不只你當下瞄準的那一題。這本身就是一份需要盤點的清單,而且往往跨很多頁——它不會自己浮出來。
  2. 你得在動手前,先量好一條涵蓋這些查詢的基線,改完之後把全部重量一次,才看得出你是把餅做大還是只是挪動。只盯你改的那一題,數字永遠漂亮——那正是陷阱本身。
  3. 這些查詢常常散在不同頁面上:一個查詢的最佳答案來自 A 頁,另一個來自 B 頁,而你在 A 頁做的事會連動到 B 頁的表現。這已經不是「優化一頁」,是「協調全站」。

一個人盯著一頁、一題、手動去做,最容易犯的錯不是做得不夠好,恰恰是做得太好——把那一題打磨得漂漂亮亮,然後在你沒看的地方賠掉三題。顧此失彼不是能力問題,是視野問題:你的注意力一次只能盯一題,但 AI 對你的評價,是把跨查詢、跨頁面的表現一起算出來的。你和引擎,用的根本不是同一個計分板。

所以,這週

  1. 先別急著優化任何一題。 花二十分鐘,把你「想被推薦」的那一題,跟你「本來就會出現」的另外三、四題,一起用訪客視窗量一遍。這是你的全局基線——沒有它,之後你做的每一次優化都在盲改。完整做法在截圖會騙人,回測不會
  2. 之後每改一次內容,把這幾題全部重量一次,不要只量你動過的那一題。幾題一起看,你才分得出自己是在做大,還是在搬運。
  3. 但完整版是全站工程,不是盯著一頁能收斂的。 盤出一份內容該服務的所有查詢、跨頁協調、每次改版後多查詢重量——這需要跨頁、跨系統的視角。想知道你現在正在犧牲哪些查詢、缺口跨了哪些頁,用 geoweb.tw 對你的網站跑一次全站分析,或把網址寄到 [email protected],我們看過再回你一份具體判斷。

一句話收尾:你不是不會優化,你是只有一雙眼睛,而 AI 有很多題要問。這件事最貴的錯誤,從來不是把一題做壞,是把一題做得太好、卻沒人在看其他題。

但書一次講完:上面這些數字都來自受控實驗、特定模型(IF-GEO 在 GPT-4o-mini/Gemini-2.0-Flash、RAID G-SEO 在 GLM-4-9B、MAGEO 在 GPT-5.2 等),別把 +0.277、30.6% 當成你網站上會原封不動複現的值。能遷移的是方向,不是小數點——「單一查詢優化會犧牲其他查詢」這個現象,在不同模型上被反覆觀察到,這才是你該記住的那一件事。


延伸閱讀