从评审前到评审后:使用大语言模型自动化评审的陷阱
数字图书馆
2025-12-30 v1 人工智能
计算机与社会
摘要
大型语言模型是通用任务求解器,其能力在学术同行评审中发挥作用,若能作为"评审前"代理,甚至可作为完全自主的"评审后"代理,都是极具价值的。尽管极具效益,但将学术同行评审自动化化作为概念,仍引发了关于安全、研究完整性以及学术评审流程有效性的广泛关注。目前大多数系统性评估前沿LLM在科学领域生成评审的研究,都未能紧密对齐评审的准则/误差情况,以及与出版后结果(如引用次数、热门论文、新颖性和颠覆性)之间的实用性。本文提出一项实验研究,我们从OpenReview收集真实评审评分,并使用多种前沿开源LLM生成论文评审,以评估将LLM纳入科学评审流程中的安全性与可靠性。我们的发现表明,尽管前沿开源LLM作为评审前筛选代理具有实用价值,但作为自主评审代理时仍存在根本性的误差风险。所有模型与人类同行评审之间相关性较弱(仅0.15),且普遍存在3-5分的高估偏差,同时给出8.0-9.0/10的极高置信度分数,尽管预测误差显著。然而,我们也观察到LLM生成的评审与发表后指标之间的相关性更强,表明其作为评审前筛选工具具有潜在价值。我们的研究既揭示了大语言模型自动化同行评审的潜在价值,也聚焦了其实施中的关键风险。我们开源了数据集,以期帮助研究社区拓展自动化科学评审的安全框架。
引用
@article{arxiv.2512.22145,
title = {Pre-review to Peer review: Pitfalls of Automating Reviews using Large Language Models},
author = {Akhil Pandey Akella and Harish Varma Siravuri and Shaurya Rohatgi},
journal= {arXiv preprint arXiv:2512.22145},
year = {2025}
}