是什麼
像 ChatGPT 這樣的 AI,是讀了大量文字之後,才學會回答問題的;這些拿來教 AI 的文字資料,叫做「語料」。數位發展部(數發部)想讓 AI 更懂台灣,所以替台灣建一個語料庫,收集台灣的文字,給開發 AI 的團隊拿去教 AI;政府把這個目標叫做「主權 AI」,也就是懂台灣的 AI。部長林宜敬的說法是,國際上大型 AI 讀的中文資料,目前還是以簡體中文為主,「要讓 AI 更理解台灣,就必須讓台灣的語言、文化與價值,成為 AI 學習的一部分。」
這個語料庫去年底上線,一開始放進去的是政府自己的資料。今年 9 月 15 日,數發部宣布開始向民間收集,現階段請出版社、電子書平台和作家,把書的簡介、試閱章節和作品授權進來。授權是無償的,也就是不付錢;數發部強調這是自願參加,作家之後改變主意,也可以申請退出。
10 月 1 日,聯合報報導了出版界的反對意見。獨立出版聯盟理事長陳夏民說:「基於對作家的尊重,內容使用應該有償。」出版商業同業公會全國聯合會理事長吳政鴻還提出一個疑問:作家就算事後退出,對已經訓練好的 AI 模型通常「無法追溯」,也就是說,AI 已經學進去的內容,拿不回來。
跟你有什麼關係
雙方爭的,是要拿什麼內容來教 AI、該不該付錢。會爭得這麼認真,是因為 AI 學了什麼,就會講什麼。數發部要做主權 AI,看的也正是這一點。
台灣自己的 AI 要拿什麼來教,還在談;國際上的大型 AI,早就學過一輪了。ChatGPT、Gemini 這些 AI,大多是從網路上公開的大量文字學出來的,你的官網、報導過你的新聞、網友在論壇上對你的評價,都可能在它讀過的資料裡。沒有人來問過你授不授權,也沒有人告訴你,它讀到的是你哪一年的樣子。
這就帶出一個品牌很少想過的問題:AI 學到的那一版你,是不是現在的你?假設宜蘭有一家民宿,三年前把餐廳改成咖啡廳、不再供應晚餐,官網也早就改了。可是網路上寫著「這家有晚餐」的舊遊記和舊評論,累積了好幾年,數量比新的說法多得多。AI 學的時候讀到哪一版,民宿老闆並不知道;客人問 AI「宜蘭哪家民宿有供應晚餐」,AI 有可能還把它列進去。就算後來那幾篇遊記的作者把文章改了,AI 早就學進去的那一版,也可能還留著。
我們把這種情形叫做「AI 失真病」:AI 講的你,不是現在的你。這家民宿的情況,是 AI 還記著它舊的樣子;另一種情況,是網路上關於你的資料太少,AI 只好拿零碎的說法,拼出一個不太像你的你。
現在要不要動
要。AI 回答客人的時候,除了用它早就學進去的東西,有時也會當場上網查。當場查的那部分,你現在把官網改好,它下次查的時候就有機會讀到;早就學進去的那部分,我們判斷要很久才換得掉,所以更要現在就開始。
早就學進去的那部分,正是前面出版界擔心的:學進去了,就拿不回來。照這個道理推,你的舊資料一旦被學進去,也要等 AI 公司哪天讓 AI 重新讀一輪資料,才有機會換成新的。我們的判斷是,網路上關於你現在的資料越清楚、越多,AI 重讀的時候讀到新資料的機會就越大。
至於 AI 什麼時候改口、是不是每一家都改口,要隔一段時間、等過幾次 AI 改版再回頭問,才知道新資料到底有沒有被學進去。
讓 AI 讀得懂你、講對你,這門功夫叫做 GEO。這種要隔一陣子就回頭問一次的事,我們的 GEO 託管會替你長期顧著:由我們的團隊幫你把網站內容修好、把其他網站上提到你的資料整理成同一套說法,再定期回頭檢查各家 AI 怎麼介紹你、講的是不是現在的你;你只要驗收結果。
填一份表單,我們會聯絡你,挑一天做一場 Demo,由我們的顧問花一段時間,當場示範給你看。那天我們先秀出你官網的 GEO 健檢分數。這是 geoweb.tw 免費的網站健檢,幫你看網站在 AI 眼裡讀不讀得懂,從 12 個面向打分數。接著請幾家主流 AI 回答你這一行客人常問的問題,聽聽它們提到你的時候,說的還是不是現在的你。
延伸閱讀
- AI 根本沒讀過你:繁中語料劣勢與品牌資訊 — AI 讀過的資料裡,繁體中文本來就少
- 中央社 MCP 開賣,30 年新聞庫接進 AI — 中央社把自家新聞直接開放給 AI 助理查,權威來源自己把內容送進 AI
- 聽清楚 AI 怎麼說你的品牌 — 先弄清楚 AI 現在怎麼講你