中文

ReviewAgents:弥合人类与AI生成论文评审之间的差距

计算与语言 2025-07-17 v3

摘要

学术论文评审是研究界一项关键但耗时的任务。随着学术出版物数量的不断增加,自动化评审过程已成为一项重大挑战。主要问题在于生成全面、准确且推理一致的评审意见,使其与人类评审员的判断保持一致。在本文中,我们通过提出ReviewAgents框架来解决这一挑战,该框架利用大型语言模型(LLM)生成学术论文评审。我们首先引入了一个新颖的数据集Review-CoT,包含142k条评审意见,旨在训练LLM代理。该数据集模拟了人类评审员的结构化推理过程——总结论文、引用相关工作、识别优缺点并生成评审结论。在此基础上,我们使用一种相关论文感知的训练方法,训练了能够进行结构化推理的LLM评审代理。此外,我们构建了ReviewAgents,一个多角色、多LLM代理的评审框架,以增强评审意见的生成过程。另外,我们提出了ReviewBench,一个用于评估LLM生成的评审意见的基准。我们在ReviewBench上的实验结果表明,虽然现有的LLM在自动化评审过程方面表现出一定的潜力,但与人类生成的评审相比仍存在差距。此外,我们的ReviewAgents框架进一步缩小了这一差距,在生成评审意见方面优于先进的LLM。

关键词

引用

@article{arxiv.2503.08506,
  title  = {ReviewAgents: Bridging the Gap Between Human and AI-Generated Paper Reviews},
  author = {Xian Gao and Jiacheng Ruan and Zongyun Zhang and Jingsheng Gao and Ting Liu and Yuzhuo Fu},
  journal= {arXiv preprint arXiv:2503.08506},
  year   = {2025}
}

备注

Work in progress