预印本:海报:我刚刚浏览的是由 LLM 撰写的网站吗?
网络与互联网体系结构
2025-10-13 v2 人工智能
计算与语言
信息检索
摘要
越来越多的网络内容由大语言模型(LLM)在极少人工输入的情况下自动生成。我们将此称为“LLM 主导”内容。由于 LLM 会抄袭和产生幻觉,LLM 主导的内容可能不可靠且不道德。然而,网站很少披露此类内容,人类读者也难以将其区分。因此,我们必须开发针对 LLM 主导内容的可靠检测器。然而,当前最先进的 LLM 检测器在网络内容上并不准确,因为网络内容具有低正例率、复杂标记和多样体裁的特点,而非 SoTA 检测器所优化的干净、散文式的基准数据。我们提出了一种高度可靠、可扩展的流水线,用于对整个网站进行分类。我们并非简单地从每个页面提取文本进行分类,而是基于多个散文式页面的 LLM 文本检测器输出来对每个站点进行分类,以提高准确率。我们通过收集总计 120 个站点的两个不同的真值数据集来训练和评估我们的检测器,并在它们之间取得了 100% 的测试准确率。在实际环境中,我们在搜索引擎结果中的 1 万个站点和 Common Crawl 存档中的 1 万个站点中检测到了相当一部分 LLM 主导的站点。我们发现 LLM 主导站点的流行度正在增长,且在搜索结果中排名靠前,这引发了关于它们对最终用户和整个 Web 生态系统影响的疑问。
引用
@article{arxiv.2507.13933,
title = {Preprint: Poster: Did I Just Browse A Website Written by LLMs?},
author = {Sichang Steven He and Ramesh Govindan and Harsha V. Madhyastha},
journal= {arXiv preprint arXiv:2507.13933},
year = {2025}
}
备注
ACM Internet Measurement Conference 2025 Poster & ACM IMC 2025 Student Workshop. 2 pages. 3 figures