虚假信息是否更加开放?一项关于 Web 上 robots.txt 守门行为的研究
计算机与社会
2026-02-24 v3
摘要
大语言模型(LLMs)正日益依赖网络爬取来保持信息更新并准确回答用户查询。这些爬虫被期望遵守 robots.txt 文件,该文件规范了自动化访问行为。本研究中,我们首次考察了声誉良好的新闻网站与虚假信息网站在配置这些文件(特别是针对 AI 爬虫)方面是否存在差异。通过分析一个精心整理的数据集,我们发现了鲜明对比:在 robots.txt 文件中,60.0% 的声誉良好网站禁止至少一个 AI 爬虫,而虚假信息网站仅为 9.1%。声誉良好网站平均禁止 15.5 个 AI 用户代理,而虚假信息网站禁止的数量不足一个。随后,我们测量了主动屏蔽行为,即当 HTTP 请求中包含 AI 爬虫用户代理时,网站拒绝返回内容的行为,并揭示出两类网站都使用了这种行为。值得注意的是,在这一方面,声誉良好新闻网站的行为与其所声明的 robots.txt 指令的一致性高于虚假信息网站。最后,我们的纵向分析揭示了这一差距随时间不断扩大:声誉良好网站的 AI 屏蔽率从 2023 年 9 月的 23% 上升至 2025 年 5 月的近 60%。我们的研究结果凸显了内容可访问性方面日益增长的不对称性,这可能影响 LLM 可用的训练数据,并对网络透明度、数据伦理以及 AI 训练实践的未来提出了重要问题。
引用
@article{arxiv.2510.10315,
title = {Is Misinformation More Open? A Study of robots.txt Gatekeeping on the Web},
author = {Nicolas Steinacker-Olsztyn and Devashish Gosain and Ha Dao},
journal= {arXiv preprint arXiv:2510.10315},
year = {2026}
}
备注
10 pages, 11 figures