中文

允许 LLM 用于润色同行评审的政策目前无法执行

计算与语言 2026-03-24 v1 人工智能 计算机与社会 机器学习

摘要

近期,多个科学会议和期刊相继实施了政策,禁止同行评审使用 LLM,除非用于润色、改写和语法校对人类撰写的评审。但这些政策是否可执行?为回答此问,我们构建了模拟多种人类-AI协作水平的同行评审数据集,并评估了五种最先进的检测器,包括两款商业系统。我们的分析表明,所有检测器在将部分经LLM润色后评审误分类为AI生成时都会出现显著比例,由此可能导致学术不端的错误指控。我们进一步探讨了是否可以利用同行评审特有的信号(包括获取论文全文和科学写作受限域),以提高检测效果。虽然在某些情境下纳入此类信号可实现检测精度的可测提升,但我们指出每种方法都存在局限,均未达到用于识别同行评审中AI使用准确性标准的要求。重要的是,我们的结果表明,近期通过AI文本检测器对AI在同行评审中的使用率进行的公开估计应谨慎解读,因为当前检测器会将混合式评审(人机协作产出)误分类为完全AI生成,从而可能高估政策违规的程度。

关键词

引用

@article{arxiv.2603.20450,
  title  = {Policies Permitting LLM Use for Polishing Peer Reviews Are Currently Not Enforceable},
  author = {Rounak Saha and Gurusha Juneja and Dayita Chaudhuri and Naveeja Sajeevan and Nihar B Shah and Danish Pruthi},
  journal= {arXiv preprint arXiv:2603.20450},
  year   = {2026}
}