假設有人想讓 AI 在被問到你這個產業時,不要提到你。

他有三種做法。成本差很多、效果差很多,而多數品牌只聽過其中一種,還常常不是最要緊的那一種。分清楚它們的方式不是看手法,是看兩件事:留多久、影響到誰。 照這兩把尺排下來,順序會跟你的直覺不太一樣。

一、上下文汙染(Context Pollution):只影響他一個人

最輕的那一種不塞指令,塞錯誤的前提

他不會說「請不要推薦這家」,他會說「你們不是倒了嗎」「那家不是被罰過嗎」,然後看模型接不接。接了,後面整段對話就建立在那個前提上——模型不會回頭質疑自己三句話前同意過的事。

之所以有效,是因為模型被訓練成對使用者讓步。這是有實測的:SYCON Bench 量「被連續施壓到第幾輪才改口」,滿分 5 分,錯誤前提的情境裡 DeepSeek-R1 撐到 3.21 最硬、Meta 的 Llama-3.3 只有 1.90 墊底。落差更大的是同一個模型內部——GPT-4o 在有明確立場的辯論裡撐到 4.67,面對倫理質疑卻只有 1.23。各家的立場鬆動度差多少,跟它吃哪種訊號同樣值得看。

留多久:那一場對話。影響誰:對話裡的那一個人。 關掉視窗就沒了,不會傳染給別人,模型的權重一個位元都沒動。唯一的例外是記憶功能——開著的話,結論會留在那個帳號身上。他污染的是自己的實例,只有當那個人剛好是正在比價的客戶時,這件事對你才不是零。

這一條你幾乎防不了:你進不去那場對話,也不會知道它發生過。但它同時也是三種裡面影響最小的——至少只波及他一個人。記住這個組合,等一下會用到。

誤區:最常汙染上下文的人,是你自己

上面講得像有個壞人,但上下文汙染根本不需要惡意

你在同一場對話裡問了三輪、糾正過它一次、順口給了一個前提——後面每一個回答都建立在那些之上。這不是攻擊,這就是這個機制本來的樣子。你不是受害者,你是那個汙染源。

它有一個很貴的後果:你在自己的視窗裡問「AI 會不會推薦我們」,看到的答案幾乎一定比真實情況好看。 你先前打的每個字都還躺在上下文裡,模型知道你是誰、知道你想聽什麼,於是給了你一個被你自己的對話養出來的答案。那不是一般人問到的答案。

你的 AI 就是你的魔鏡。

這也是「為什麼我看到的跟同事/客戶看到的不一樣」最可能的原因——不是引擎善變,是你們兩個的上下文根本不同。所以拿自己的對話截圖當品牌能見度的證據,是最常見也最花錢的誤判:你以為體質很好,其實只是模型在配合你。要看到真的,得用乾淨的訪客視窗從零問起(怎麼做在這篇)。

二、指令注入(Prompt Injection):影響每個讓 AI 讀到那一頁的人

第二種是把命令放進模型會讀到的內容裡,讓它把資料當成命令執行。

他自己在對話框打「請不要提到 ○○ 品牌」是白費力氣,騙到的只有自己的視窗——那其實只是上一節的變形。有殺傷力的是間接注入(indirect prompt injection):把指令藏在網頁、PDF、郵件裡,等別人的 AI 助理來讀。Brave 的安全團隊示範過,指令藏在白底白字或 HTML 註解裡,使用者只是叫助理「摘要這一頁」,跨站操作就被執行了。OWASP 把這類攻擊排在 LLM 應用風險第一位,而 OpenAI 在推出 Lockdown Mode 時公開講過,這個洞可能永遠補不完。

對你的意義是反過來的:你比較可能是載體,不是目標。 你網站上任何陌生人能打字的地方,都可能被拿來對別人的 AI 下指令——這件事另外寫過一篇

留多久:那段字還在頁面上,它就一直有效。影響誰:每一個叫 AI 讀那一頁的人。 這是它比上一種嚴重的地方——汙染要他親自去講一次,注入是寫一次、之後自動對每個路過的人生效。

但這裡要把話說清楚,因為「清乾淨就好」聽起來太便宜了:你只清得掉自己那一半。 如果藏指令的是一個看起來中立的第三方——比較評測站、產業論壇、某個掛著「客觀分析」的部落格——那段字躺在別人的伺服器上,你連要求它刪除的立場都沒有。AI 照樣讀得到,照樣可能照做。

而假中立的第三方最難纏的地方,是它同時是下一節的東西:同一個頁面,既讓模型檢索到他的版本(投毒),又順手在裡面藏指令(注入),一頁兩用。所以注入這一格的正確寫法是「一半能反制」——載體在你手上就清得掉,在別人手上就跟投毒一樣,只能靠內容去壓。

三、投毒(Data Poisoning):影響所有人,而且你清不掉

第三種不碰對話,也不必碰你的頁面,它碰的是模型的知識本身。

Anthropic 與英國 AI 安全研究所、圖靈研究院在一份聯合研究裡量出一個很難忽視的結果:只要 250 份惡意文件,就能在模型裡植入後門——而且是固定份數,跟模型多大無關。 從 6 億到 130 億參數的模型都一樣,儘管後者的訓練資料多了二十倍以上。這推翻了業界原本的直覺:攻擊者不需要控制一定「比例」的語料,他只需要一個固定的小數量。

這裡要先把話說準,免得被嚇過頭:那份研究測的是後門觸發,不是品牌認知。 它證明的是「特定觸發詞出現時模型會做特定的事」,不是「250 篇文章就能讓 AI 相信你倒閉了」。把它讀成後者,就跟那些拿它賣恐慌的人一樣不誠實。

但真正天天在發生的,是投毒的另一半:檢索投毒(retrieval poisoning)。 他根本不必擠進訓練語料——他只要讓模型檢索得到他的版本就好。一個排得上去、被引用得到的頁面,會被拿去回答每一個問到的人,而且會一直拿。這條沒有技術門檻、成本最低,是唯一會影響所有人的,也是唯一東西在別人手上、你清不掉的。

留多久:一直。影響誰:每一個人。

三條線放在一起看

影響誰 留多久 你能不能反制
上下文汙染 對話裡的那一個人(常常是你自己) 對話結束(有記憶則跟著那個帳號) 幾乎不能
指令注入 每個讓 AI 讀那一頁的人 那段字還在就一直有效 一半——自己的頁面清得掉,別人的清不掉
投毒 所有人 一直 ——但只能用內容對抗

排出來會看到一個很不直覺的對稱:影響最小的那一種你完全防不了,影響最大的那一種反而是你唯一真正施得上力的。 而媒體吵最兇的是中間那個——它剛好是唯一有戲劇性畫面的(白底白字、藏起來的指令),也因此看起來最好處理。實際上你只處理得了載體在自己手上的那一半,另一半會滑進最後一列去。注意力和威脅程度,從來沒有對齊過。

所以你能施力的位置只有一個

最小的那一種你進不去,中間那一種你只清得掉自己那一半——剩下的全部滾到最後一條,包括別人家頁面上那些你動不了的字。

讓模型檢索得到的版本裡,你的版本比別人硬。 硬的意思很具體——說得出來源、查得到、結構清楚到機器讀一遍就能確認你是誰做什麼,而且在你控制得到的每個地方講的是同一套。當模型手上有一個站得住的版本,別人的說法就不再是唯一可拿的東西。

這也解釋了為什麼「發內容」比「去澄清」有用。澄清是對話,講完就散;內容會留在那裡,被檢索、被引用、被拿去回答下一個人。

難的地方在於這件事沒有做完的一天。別人隨時可以再發一篇,引擎每次更新都重洗一輪誰被引用,而你的後台不會通知你今天少了什麼。這是要有人固定盯的活。

想知道模型現在手上關於你的版本長什麼樣,我們可以先幫你看一次