LLM-REVal:我们能信赖LLM审稿人吗?
计算与语言
2025-10-15 v1 人工智能
摘要
大语言模型 (LLM) 的快速发展鼓舞着研究者将其广泛集成到学术工作流程中,可能重新塑造研究的实践方式和审查方式。尽管先前的研究凸显了LLM在支持研究和同行评审方面的潜力,但其在学术工作流程中的双重角色以及研究与评审之间复杂的相互作用带来了尚未充分探索的新风险。本研究聚焦于LLM深度集成到同行评审和研究过程可能对学术公平性产生的影响,考察将LLM用作审稿人的潜在风险。该模拟包括一个研究代理,它生成论文并进行修订,以及一个审稿代理,它评估提交的论文。基于模拟结果,我们进行了人类标注,发现LLM基于的评审与人类判断之间存在显著的偏离:(1) LLM审稿人系统性地为LLM撰写的论文给予更高的分数,明显高于人类撰写的论文;(2) LLM审稿人持续低估经批判性陈述(如风险、公平性)的人类撰写论文的分数,即使经过多次修订也依然如此。我们的分析表明,这些结果源于LLM审稿人的两个主要偏见:一种偏好LLM生成写作风格的语言特征偏见,以及对批判性陈述的厌恶。这些结果凸显了如果在缺乏充分审慎的情况下将LLM部署到同行评审周期中,对人类作者和学术研究所带来的风险和公平性问题。另一方面,由LLM审稿人引导的修订在LLM-based和人类评估中均实现了质量提升,说明LLM作为审稿人对于初学者和提升低质量论文具有潜力。
引用
@article{arxiv.2510.12367,
title = {LLM-REVal: Can We Trust LLM Reviewers Yet?},
author = {Rui Li and Jia-Chen Gu and Po-Nien Kung and Heming Xia and Junfeng liu and Xiangwen Kong and Zhifang Sui and Nanyun Peng},
journal= {arXiv preprint arXiv:2510.12367},
year = {2025}
}