3 個免費的網站權威評估數據集 Tranco Common Crawl Wayback Machine tranco-list.eu commoncrawl.org archive.org 給的訊號 給的訊號 給的訊號 全球 Top 1M 排名 爬蟲覆蓋與連結 首次存檔年份 每日更新 / CSV 下載 月更 / WARC + 衍生資料 即時 / CDX API 回答:「這站多熱門」 回答:「LLM 訓練看過」 回答:「存在多久了」

為什麼需要免費數據集?

要評估某個網站(自己的、競爭對手的、或合作對象的)外部認知強度,付費工具如 Ahrefs / SimilarWeb / Semrush 月費 $129+ 起跳,且 ToS 限制嚴格。

但學術界 / 公開資料界其實有幾個高品質的開放數據集,內容跟付費工具的核心信號高度重疊,只是沒有漂亮的 dashboard 包裝。本文介紹三個最實用的,以及怎麼用它們組合起來做評估。


一、Tranco — 全球 Top 1M 域名排名(每日更新)

它是什麼

Tranco 是 KU Leuven 與 Stanford 的研究專案,整合 4 個來源算出全球熱門網站排名:

  • Cisco Umbrella(DNS query 量,數百萬企業端點匿名統計)
  • Cloudflare Radar
  • Chrome User Experience Report (CrUX)
  • Majestic Million

四個來源每日更新,避免單一來源的偏誤(這是 Alexa rank 在 2022 退役後最常用的繼任者)。

它能告訴你什麼

「這個網站在全球 Top 1M 內排第幾名」

排名越前面 = DNS 查詢量越大 = 真實流量越高。這比 SimilarWeb 的「估算流量」更可信——因為它是真實 DNS 行為,不是統計推估。

怎麼取得

https://tranco-list.eu/api/lists/date/today

或直接下載當日 CSV(~30 MB,含 1M 條目)。CC BY 4.0 授權,無 ToS 限制。

怎麼解讀

  • 排名 < 1,000:全球頂尖網站(Wikipedia、Google、Reddit、各大平台)
  • 排名 1K–10K:產業領先者
  • 排名 10K–100K:知名品牌或活躍社群
  • 排名 100K–1M:可被 AI 訓練語料涵蓋的下緣
  • 不在 1M 內:對 LLM 訓練語料而言「不存在」

限制

  • 只有 Top 1M。新站 / 小型站完全看不到
  • 排名是相對位置,不是絕對流量數字
  • 不分類(看不出「知名 vs 學術 vs 政府」)

二、Common Crawl — LLM 訓練語料的源頭

它是什麼

Common Crawl 是 2007 年至今每月持續爬取的開放網路檔案。每月新增約 2.5 billion 頁面,全部以 WARC 格式公開在 AWS S3。

OpenAI、Anthropic、Google、Meta 訓練 LLM 時都用 Common Crawl 作為主要語料來源之一。 換句話說:進得了 Common Crawl 的網頁 = 進得了 LLM 訓練資料的入口票

它能告訴你什麼

「這個網站有多少頁被爬蟲收錄?被多少其他網站連到?」

怎麼取得

兩種主要查詢方式:

1. CDX API(單次查詢,免費)

https://index.commoncrawl.org/CC-MAIN-2026-01-index?url=geoweb.tw&output=json

回傳該網站在該月 crawl 中被收錄的所有 URL 與時間戳。

2. cc-webgraph 衍生資料(聚合分析)

https://commoncrawl.org/web-graphs

下載每季發布的 domain-level webgraph(壓縮 ~1.5 GB),含每個 domain 的:

  • Harmonic centrality(≈ Domain Rating)
  • In-degree(= Referring Domains 數)
  • Out-degree(= 你連向多少他站)

下載一次後完全本地查詢,沒有 API 呼叫上限。

怎麼解讀

  • 被收錄的頁數 < 100:網站對 LLM 訓練語料貢獻極低
  • 100–10K:一般中小型網站,部分內容會進訓練池
  • 10K+:大量內容進訓練語料,AI 對你品牌的「內隱知識」基本盤穩固

限制

  • 月更 + 季更,不適合追蹤即時變化
  • WARC 檔案巨大,需要 streaming 處理
  • 個別頁面的爬取時間不可控(不能要求 Common Crawl 來爬你網站)

三、Wayback Machine — 網站存在年資的可信證據

它是什麼

Internet Archive 自 1996 年至今儲存的網頁存檔。每個被存檔過的網頁時間戳都是可被外部驗證的時間錨點

LLM 在判斷網站可信度時會考量「這個網站存在多久了」——但網站自己宣稱的成立日期可能造假。Wayback Machine 的首次存檔時間是第三方時間錨點,AI 廠商認這個。

它能告訴你什麼

「這個網站第一次被存檔是什麼時候?最近一次又是什麼時候?」

怎麼取得

最有用的是 CDX API:

https://web.archive.org/cdx/search/cdx?url=geoweb.tw&limit=1&from=19960101&output=json&filter=statuscode:200

回傳該域名第一個 200 status 的存檔時間戳。

GeoWeb 自家的「站外能見度」維度就是用這個 API(早先用 archive.org/wayback/available 但對熱門站會回空,改 CDX 後穩定了)。

怎麼解讀

  • 首次存檔 < 3 年前:新站,外部認知尚在累積
  • 3–10 年:穩定品牌,LLM 對你有基本認知
  • 10+ 年:老牌網站,LLM 訓練語料基本盤深厚

限制

  • 只反映「被存檔」而不是「實際內容品質」
  • Wayback 對熱門 / 受歡迎網站更傾向頻繁存檔,這形成輕微的 bias
  • 部分網站主動禁止 Wayback 存檔(透過 robots.txt 的 User-agent: ia_archiver

三個信號怎麼一起用?

單看一個信號容易誤判,三個交叉看才有結論:

場景 A:高 Tranco + 高 Common Crawl + 高 Wayback

真正的權威品牌。AI 引用機率高,無需特別 GEO 努力(但仍要結構化)。

場景 B:低 Tranco + 高 Common Crawl + 高 Wayback

老牌網站但流量已衰退。需要重新啟用內容更新頻率。

場景 C:高 Tranco + 低 Common Crawl + 低 Wayback

新興爆紅網站。AI 訓練語料還沒跟上,需要等 1–2 個月 / 季更新週期。短期靠即時引用爬蟲(ChatGPT-User、PerplexityBot)。

場景 D:低 Tranco + 低 Common Crawl + 低 Wayback

起點極低。需要全面性 GEO 規劃 + 媒體公關長期累積。


怎麼快速取得這些信號

GeoWeb 的「站外能見度」維度自動整合上述三項 + DuckDuckGo 知識圖譜 + AI 平台回測度,跑一次健檢就能看到自家網站在這 5 個信號的綜合評估。

👉 跑一次免費 GEO 健檢

如果你想更深度的競爭對手分析(自家 vs 同業 5–10 家的全信號比對 + 跨季趨勢追蹤),這部分需要客製化工具與長期資料蒐集,是 GEO 顧問服務的範圍:[email protected]


GEO 進階系列。前一篇:「為什麼 Wikipedia 收錄是 GEO 的最強信號之一?」