中文

从复制到重新设计:探索基于 LLM 的同行评审中的两两比较

计算与语言 2025-09-26 v2

摘要

大型语言模型(LLM)的出现提供了前所未有的机会,重新构想同行评审,超越了传统工作流程的约束。尽管如此,此前的努力主要集中在复制传统评审工作流程,使 LLM 充当人类评审的直接替代品,而有限的关注力度投向探索 fundamentally 重新构想 LLM 如何参与学术评审过程的新范式。本文介绍并探索了一种新型机制,利用 LLM 代理执行手稿之间的两两比较,而非对 individual 手稿进行评分。通过聚合来自大量两两评估的结果,这种方法能够更准确、更稳健地衡量手稿相对质量。我们的实验表明,这种比较方法在识别高影响力手稿方面显著优于传统的评分方法。然而,我们的分析也揭示了在选择过程中出现的新兴偏见,尤其是研究主题的 novelty 降低以及制度不平衡增加。这些发现既凸显了重新构想同行评审以 LLM 为核心的变革潜力,也强调了未来系统必须解决的关键挑战,以确保公平性和多样性。

关键词

引用

@article{arxiv.2506.11343,
  title  = {From Replication to Redesign: Exploring Pairwise Comparisons for LLM-Based Peer Review},
  author = {Yaohui Zhang and Haijing Zhang and Wenlong Ji and Tianyu Hua and Nick Haber and Hancheng Cao and Weixin Liang},
  journal= {arXiv preprint arXiv:2506.11343},
  year   = {2025}
}