中文

REMOR:基于 LLM 推理与多目标强化学习的自动同行评审生成

人工智能 2025-06-30 v2

摘要

基于 AI 的同行评审系统倾向于产生浅薄且过度赞美的建议,与人类反馈存在差异。本文评估了使用多目标强化学习训练的推理 LLM(REMOR)能否克服这些限制。我们首先设计了与人类评审评估一致的多维度奖励函数,其中维度与评审本身(如批评、新颖性)以及评审与手稿之间的关系(即相关性)有关。首先,我们在 PeerRT 上对 DeepSeek-R1-Distill-Qwen-7B 进行监督式微调,使用 LoRA。随后,我们应用分组相对策略优化(GRPO)训练两个模型:REMOR-H(使用人类对齐奖励)和 REMOR-U(使用均匀奖励)。有趣的是,人类对齐奖励对通常与强评审相关的维度进行惩罚,导致 REMOR-U 生成更具实质性的反馈。我们的结果表明,REMOR-U 和 REMOR-H 的平均奖励值是人类评审、非推理的状态最佳代理式多模态 AI 评审系统以及通用商业 LLM 基准的两倍以上。我们发现,最佳 AI 评审与人类评审在质量上相当,但 REMOR 避免了低质量人类评审的长尾问题。我们讨论了推理在实现这些改进方面的作用,并发布了人类对齐同行评审奖励(HPRR)函数、同行评审推理增强痕迹(PeerRT)数据集以及 REMOR 模型模型,认为这些资源可以推动该领域的进展。

关键词

引用

@article{arxiv.2505.11718,
  title  = {REMOR: Automated Peer Review Generation with LLM Reasoning and Multi-Objective Reinforcement Learning},
  author = {Pawin Taechoyotin and Daniel Acuna},
  journal= {arXiv preprint arXiv:2505.11718},
  year   = {2025}
}

备注

18 pages, 6 figures