爬虫选择性遵守 robots.txt 指令:来自大规模实证研究的证据
网络与互联网体系结构
2025-10-24 v2 密码学与安全
计算机与社会
摘要
近年来,随着传统爬虫加入新的 AI 专用机器人,在线数据抓取呈现出新的维度。为抵御不需要的抓取,许多网站使用 Robots Exclusion Protocol (REP) 等工具,该协议在网站根目录放置 robotstxt 文件以规定爬虫行为。然而,REP 的有效性尚不明确。轶事证据表明某些机器人对其遵守程度较差,但尚无严格的研究支持(或反驳)这一说法。为了解 REP 的优点与局限,我们使用本机构的匿名 Web 日志,对 Web 爬虫遵守 robotstxt 指令的情况进行了首次大规模研究。我们通过一系列受控的 robotstxt 实验,分析了 130 个自声明机器人(及许多匿名机器人)在 40 天内的行为。我们发现机器人不太可能遵守更严格的 robotstxt 指令,且某些类别的机器人(包括 AI 搜索爬虫)几乎不检查 robotstxt。这些发现表明,依赖 robotstxt 文件来防止不需要的抓取是有风险的,并突出了对替代方法的需求。
引用
@article{arxiv.2505.21733,
title = {Scrapers selectively respect robots.txt directives: evidence from a large-scale empirical study},
author = {Taein Kim and Karstan Bock and Claire Luo and Amanda Liswood and Chloe Poroslay and Emily Wenger},
journal= {arXiv preprint arXiv:2505.21733},
year = {2025}
}
备注
13 pages