中文

这是一个本地域:从公开数据收集国家代码顶级域

网络与互联网体系结构 2023-09-06 v1 信息检索

摘要

域名列表是对 Web 进行代表性普查的关键要素。遗憾的是,此类普查通常缺乏对国家和地区顶级域(ccTLD)下域名的视角。这引入了不希望的偏差:许多国家拥有丰富的本地 Web,若不考虑其 ccTLD 则始终隐藏。ccTLD 很少被考虑的原因是获取权限——即便可能——往往费时费力。为此,我们追问:从公开来源中能了解到 ccTLD 的什么?我们从证书透明日志和 Common Crawl 的 6 年公开数据中提取 ccTLD 下的域名。我们针对拥有完整 DNS 区域的 19 个 ccTLD 将其与真实情况对比。我们发现公开数据覆盖了这些 ccTLD 的 43%–80%,且覆盖率随时间增长。通过进一步对比端口扫描数据,我们表明这些公开来源揭示了 ccTLD 下 Web 存在的显著部分。我们得出结论:在无法完全访问 ccTLD 的情况下,从公开来源习得的域名可作为 Web 普查的良好代理。

关键词

引用

@article{arxiv.2309.01441,
  title  = {This Is a Local Domain: On Amassing Country-Code Top-Level Domains from Public Data},
  author = {Raffaele Sommese and Roland van Rijswijk-Deij and Mattijs Jonker},
  journal= {arXiv preprint arXiv:2309.01441},
  year   = {2023}
}

备注

6 pages double-column, 4 figures; submitted to ACM SIGCOMM CCR