中文

大规模监控 AI 修改内容:ChatGPT 对 AI 会议同行评审影响的案例研究

计算与语言 2026-05-20 v4 人工智能 机器学习 社会与信息网络

摘要

我们提出了一种方法,用于估计大型语料库中可能由大型语言模型(LLM)大幅修改或生成的文本比例。我们的最大似然模型利用专家撰写和 AI 生成的参考文本,准确且高效地在语料库层面检查现实世界中的 LLM 使用情况。我们将此方法应用于 ChatGPT 发布后举行的 AI 会议科学同行评审的案例研究:ICLR 2024、NeurIPS 2023、CoRL 2023 和 EMNLP 2023。我们的结果表明,提交给这些会议的同行评审中,约有 6.5% 至 16.9% 的文本可能被 LLM 大幅修改,即超出了拼写检查或 minor 写作更新的范畴。生成文本出现的情境提供了对用户行为的洞察:在报告较低置信度、接近截止日期提交以及不太可能回应作者反驳的评审中,估计的 LLM 生成文本比例更高。我们还观察到了语料库层面生成文本的趋势,这些趋势在个体层面可能过于细微而无法检测,并讨论了此类趋势对同行评审的影响。我们呼吁未来的跨学科工作来考察 LLM 的使用如何改变我们的信息和知识实践。

关键词

引用

@article{arxiv.2403.07183,
  title  = {Monitoring AI-Modified Content at Scale: A Case Study on the Impact of ChatGPT on AI Conference Peer Reviews},
  author = {Weixin Liang and Zachary Izzo and Yaohui Zhang and Haley Lepp and Hancheng Cao and Xuandong Zhao and Lingjiao Chen and Haotian Ye and Sheng Liu and Zhi Huang and Daniel A. McFarland and James Y. Zou},
  journal= {arXiv preprint arXiv:2403.07183},
  year   = {2026}
}

备注

46 pages, 31 figures, ICML '24