為什麼需要免費數據集?
要評估某個網站(自己的、競爭對手的、或合作對象的)外部認知強度,付費工具如 Ahrefs / SimilarWeb / Semrush 月費 $129+ 起跳,且 ToS 限制嚴格。
但學術界 / 公開資料界其實有幾個高品質的開放數據集,內容跟付費工具的核心信號高度重疊,只是沒有漂亮的 dashboard 包裝。本文介紹三個最實用的,以及怎麼用它們組合起來做評估。
一、Tranco — 全球 Top 1M 域名排名(每日更新)
它是什麼
Tranco 是 KU Leuven 與 Stanford 的研究專案,整合 4 個來源算出全球熱門網站排名:
- Cisco Umbrella(DNS query 量,數百萬企業端點匿名統計)
- Cloudflare Radar
- Chrome User Experience Report (CrUX)
- Majestic Million
四個來源每日更新,避免單一來源的偏誤(這是 Alexa rank 在 2022 退役後最常用的繼任者)。
它能告訴你什麼
「這個網站在全球 Top 1M 內排第幾名」
排名越前面 = DNS 查詢量越大 = 真實流量越高。這比 SimilarWeb 的「估算流量」更可信——因為它是真實 DNS 行為,不是統計推估。
怎麼取得
https://tranco-list.eu/api/lists/date/today
或直接下載當日 CSV(~30 MB,含 1M 條目)。CC BY 4.0 授權,無 ToS 限制。
怎麼解讀
- 排名 < 1,000:全球頂尖網站(Wikipedia、Google、Reddit、各大平台)
- 排名 1K–10K:產業領先者
- 排名 10K–100K:知名品牌或活躍社群
- 排名 100K–1M:可被 AI 訓練語料涵蓋的下緣
- 不在 1M 內:對 LLM 訓練語料而言「不存在」
限制
- 只有 Top 1M。新站 / 小型站完全看不到
- 排名是相對位置,不是絕對流量數字
- 不分類(看不出「知名 vs 學術 vs 政府」)
二、Common Crawl — LLM 訓練語料的源頭
它是什麼
Common Crawl 是 2007 年至今每月持續爬取的開放網路檔案。每月新增約 2.5 billion 頁面,全部以 WARC 格式公開在 AWS S3。
OpenAI、Anthropic、Google、Meta 訓練 LLM 時都用 Common Crawl 作為主要語料來源之一。 換句話說:進得了 Common Crawl 的網頁 = 進得了 LLM 訓練資料的入口票。
它能告訴你什麼
「這個網站有多少頁被爬蟲收錄?被多少其他網站連到?」
怎麼取得
兩種主要查詢方式:
1. CDX API(單次查詢,免費)
https://index.commoncrawl.org/CC-MAIN-2026-01-index?url=geoweb.tw&output=json
回傳該網站在該月 crawl 中被收錄的所有 URL 與時間戳。
2. cc-webgraph 衍生資料(聚合分析)
https://commoncrawl.org/web-graphs
下載每季發布的 domain-level webgraph(壓縮 ~1.5 GB),含每個 domain 的:
- Harmonic centrality(≈ Domain Rating)
- In-degree(= Referring Domains 數)
- Out-degree(= 你連向多少他站)
下載一次後完全本地查詢,沒有 API 呼叫上限。
怎麼解讀
- 被收錄的頁數 < 100:網站對 LLM 訓練語料貢獻極低
- 100–10K:一般中小型網站,部分內容會進訓練池
- 10K+:大量內容進訓練語料,AI 對你品牌的「內隱知識」基本盤穩固
限制
- 月更 + 季更,不適合追蹤即時變化
- WARC 檔案巨大,需要 streaming 處理
- 個別頁面的爬取時間不可控(不能要求 Common Crawl 來爬你網站)
三、Wayback Machine — 網站存在年資的可信證據
它是什麼
Internet Archive 自 1996 年至今儲存的網頁存檔。每個被存檔過的網頁時間戳都是可被外部驗證的時間錨點。
LLM 在判斷網站可信度時會考量「這個網站存在多久了」——但網站自己宣稱的成立日期可能造假。Wayback Machine 的首次存檔時間是第三方時間錨點,AI 廠商認這個。
它能告訴你什麼
「這個網站第一次被存檔是什麼時候?最近一次又是什麼時候?」
怎麼取得
最有用的是 CDX API:
https://web.archive.org/cdx/search/cdx?url=geoweb.tw&limit=1&from=19960101&output=json&filter=statuscode:200
回傳該域名第一個 200 status 的存檔時間戳。
GeoWeb 自家的「站外能見度」維度就是用這個 API(早先用 archive.org/wayback/available 但對熱門站會回空,改 CDX 後穩定了)。
怎麼解讀
- 首次存檔 < 3 年前:新站,外部認知尚在累積
- 3–10 年:穩定品牌,LLM 對你有基本認知
- 10+ 年:老牌網站,LLM 訓練語料基本盤深厚
限制
- 只反映「被存檔」而不是「實際內容品質」
- Wayback 對熱門 / 受歡迎網站更傾向頻繁存檔,這形成輕微的 bias
- 部分網站主動禁止 Wayback 存檔(透過 robots.txt 的
User-agent: ia_archiver)
三個信號怎麼一起用?
單看一個信號容易誤判,三個交叉看才有結論:
場景 A:高 Tranco + 高 Common Crawl + 高 Wayback
真正的權威品牌。AI 引用機率高,無需特別 GEO 努力(但仍要結構化)。
場景 B:低 Tranco + 高 Common Crawl + 高 Wayback
老牌網站但流量已衰退。需要重新啟用內容更新頻率。
場景 C:高 Tranco + 低 Common Crawl + 低 Wayback
新興爆紅網站。AI 訓練語料還沒跟上,需要等 1–2 個月 / 季更新週期。短期靠即時引用爬蟲(ChatGPT-User、PerplexityBot)。
場景 D:低 Tranco + 低 Common Crawl + 低 Wayback
起點極低。需要全面性 GEO 規劃 + 媒體公關長期累積。
怎麼快速取得這些信號
GeoWeb 的「站外能見度」維度自動整合上述三項 + DuckDuckGo 知識圖譜 + AI 平台回測度,跑一次健檢就能看到自家網站在這 5 個信號的綜合評估。
如果你想更深度的競爭對手分析(自家 vs 同業 5–10 家的全信號比對 + 跨季趨勢追蹤),這部分需要客製化工具與長期資料蒐集,是 GEO 顧問服務的範圍:[email protected]
GEO 進階系列。前一篇:「為什麼 Wikipedia 收錄是 GEO 的最強信號之一?」