中文

爬虫选择性遵守 robots.txt 指令:来自大规模实证研究的证据

网络与互联网体系结构 2025-10-24 v2 密码学与安全 计算机与社会

摘要

近年来,随着传统爬虫加入新的 AI 专用机器人,在线数据抓取呈现出新的维度。为抵御不需要的抓取,许多网站使用 Robots Exclusion Protocol (REP) 等工具,该协议在网站根目录放置 robots..txt 文件以规定爬虫行为。然而,REP 的有效性尚不明确。轶事证据表明某些机器人对其遵守程度较差,但尚无严格的研究支持(或反驳)这一说法。为了解 REP 的优点与局限,我们使用本机构的匿名 Web 日志,对 Web 爬虫遵守 robots..txt 指令的情况进行了首次大规模研究。我们通过一系列受控的 robots..txt 实验,分析了 130 个自声明机器人(及许多匿名机器人)在 40 天内的行为。我们发现机器人不太可能遵守更严格的 robots..txt 指令,且某些类别的机器人(包括 AI 搜索爬虫)几乎不检查 robots..txt。这些发现表明,依赖 robots..txt 文件来防止不需要的抓取是有风险的,并突出了对替代方法的需求。

关键词

引用

@article{arxiv.2505.21733,
  title  = {Scrapers selectively respect robots.txt directives: evidence from a large-scale empirical study},
  author = {Taein Kim and Karstan Bock and Claire Luo and Amanda Liswood and Chloe Poroslay and Emily Wenger},
  journal= {arXiv preprint arXiv:2505.21733},
  year   = {2025}
}

备注

13 pages