LLM 生成的论文与人类撰写的论文?——ArXiv 上评审与非评审论文的比较研究
数字图书馆
2026-01-27 v1 计算与语言
计算机与社会
摘要
ArXiv 最近禁止在计算机科学领域上传未经评审的综述论文, citing 该领域存在大量 LLM 生成内容。然而,这一决定没有附带定量证据。在本研究中,我们通过测量近年来评审与非评审研究论文中 LLM 生成内容的比例来调查此主张。我们采用两种高质量检测方法,发现 LLM 生成内容在两类论文中均有显著增加,评审论文中的比例更高。然而,考虑到 LLM 生成论文在每个类别中的数量,非评审 LLM 生成论文的估计值几乎高出六倍。此外,我们发现该政策将对某些领域的论文影响更大,计算机社会子学科可能面临 50% 的裁减。我们的分析为评估此类政策决策提供了基于证据的框架,我们发布了代码以便未来调查:https://github.com/yanaiela/llm-review-arxiv。
引用
@article{arxiv.2601.17036,
title = {LLM-Generated or Human-Written? Comparing Review and Non-Review Papers on ArXiv},
author = {Yanai Elazar and Maria Antoniak},
journal= {arXiv preprint arXiv:2601.17036},
year = {2026}
}