一句話:把網站從「被讀」變成「被問」
過去 AI 要用你的內容,得先派爬蟲抓整頁 HTML,再自己猜哪段是價格、哪段是規格、哪段是廢話。NLWeb 反過來——你主動把整理好的資料開成一個可以用自然語言查詢的端點,AI 不用猜,直接問。
這是微軟 2025 年開源的專案。它不發明新格式,而是吃你網站既有的 Schema.org 結構化資料加上 RSS/feed,套上一層檢索與語言模型,讓你的內容變成一個能對話的介面。重點在那個「既有」:你過去為 SEO/GEO 做的結構化資料,在這裡不是重做,是直接被當燃料。
機制拆解:資料是怎麼從你的頁面跑到答案裡的
把它拆成三段就清楚了:
- 入料——NLWeb 讀你頁面裡的 Schema.org(Product、Article、FAQPage、LocalBusiness 這些)和 RSS。結構化得越乾淨、實體標得越一致,這一步拿到的料就越準。這一步的品質,等於你網站體質的品質——垃圾進、垃圾出。
- 檢索——它把這些資料建成可被語意查詢的索引(向量檢索那一類)。使用者或代理問一句話,系統先找出你內容裡相關的片段。
- 回答——語言模型只根據「檢索到的你的內容」生成答案,而不是憑模型記憶亂編。換句話說,答案被綁在你的資料上,這正是大家想要的「有來源、可究責」的形態。
關鍵差別:傳統爬蟲是把你的頁面當一坨文字硬讀;NLWeb 是讓 AI 查你已經結構化好的事實。同樣一個問題「你們週日有開嗎」,前者要從一段文案猜,後者直接命中你 openingHours 欄位。
每個實例同時是一台 MCP server——這才是重點
NLWeb 真正的份量不在「網站多一個聊天框」,而在每個實例同時是一台 MCP server。
MCP(Model Context Protocol)是讓 AI 代理呼叫外部工具與資料源的介面。當你的網站是一台 MCP server,意思是:未來在代理生態裡,AI 不是「順便爬到你」,而是可以把你當成一個能主動呼叫的工具——「去問問這家店的庫存」。
這是從「網頁被瀏覽」轉向「端點被呼叫」的訊號。代理開始替使用者跑流程時,能被直接呼叫、回話又有結構的站,會比只剩一堆靜態 HTML 的站先被接上線。
為什麼這跟 GEO 是同一條路
GEO 的核心從來只有一句:讓 AI 把你當成可信、結構清楚、好取用的來源。
NLWeb 把這句話推到極致。它不是要你學新東西,而是把你在 GEO 上已經做的功變現:
- 你把 Schema.org 標乾淨了 → NLWeb 入料就準。
- 你把實體(公司名、產品名、地點)做一致了 → 檢索不會張冠李戴。
- 你的內容本來就是「一頁一個清楚身份」 → 開成端點後,每個身份都答得乾淨。
反過來說,體質爛的站,接 NLWeb 也是空的:結構化資料殘缺、實體東一個西一個,開成端點只會把混亂放大給 AI 看。NLWeb 不是捷徑,是一面照妖鏡——照出你地基打得紮不紮實。
誰現在該關心、誰先別碰
先講老實話:NLWeb 不是「裝了就會被主流 AI 引用」。它是開源實驗、不是業界標準,採用還在早期,主流 AI 引擎也沒有承諾「凡 NLWeb 端點一律優先取用」。把它當成銀彈會失望。
那它的價值在哪?在方向。它把「結構化資料 + 對話介面 = 先被接上」這條路標得很清楚。所以務實的分法是:
- 現在就值得留意:內容量大、品項多、查詢密集的站(電商、目錄、媒體、知識庫)。這類站「被問」的場景最多,未來代理直接查的紅利也最大。
- 先不必動手自架:一般中小企業官網。你現在花力氣去架一台 NLWeb server,遠不如先把體質做對划算——因為體質是這一切的前提,而且不管未來介面換幾輪都用得到。
注意這裡的分工:自己架端點是工程活,可以晚點再說;但把結構化資料和實體做對,是現在、且無論如何都要做的事。前者是選配,後者是地基。
對你的意義
不必今天就架 NLWeb。但它再一次驗證同一件事,而且講得比以前更白:
乾淨的結構化資料 + 一致的實體,才是地基。新介面只是把地基變現的出口。
NLWeb、MCP、未來還會冒出的下一個介面,全都站在同一個前提上——你的內容夠不夠結構化、你的身份夠不夠一致。地基沒打好,接什麼介面都是空的;地基紮實,每一個新出口都自動是你的紅利。
這也是為什麼我們把力氣放在體質,而不是追每一個新玩具。玩具會換,地基不會。