Re2:面向全流程同行评审与多轮驳稿讨论的一致性数据集
计算与语言
2026-03-16 v2 人工智能
机器学习
摘要
同行评审是 AI 等领域科学进步的关键组成部分,但随着投稿量的快速增长,审阅系统受到压力,这不可避免地导致审阅者短缺和审查质量下降。除了日益增长的研究热度之外,另一个导致系统过载的关键因素是由于缺乏有效工具帮助作者在提交前对其工作进行自我评估,而导致大量次级稿件的重复提交。在大型语言模型(LLM)在帮助作者和审阅者方面展现出巨大潜力,但其性能根本受限于同行评审数据的质量。然而,现有的同行评审数据集面临三个主要局限性:(1)数据多样性有限,(2)由于使用修订稿而非初始稿件,数据一致性和质量不高,(3)不足以支持涉及驳稿和审阅者-作者互动的任务。为解决这些挑战,我们引入了最大的一致性确保型同行评审和驳稿数据集,称为 Re^2,包含 19,926 篇初始稿件、70,668 条评审评论和 53,818 篇驳稿,来自 24 场会议和 21 场研讨会的 OpenReview。我们将驳稿和讨论阶段建模为多轮对话范式,以支持传统的静态评审任务和动态交互式 LLM 助手,为作者提供更实用的指导,以完善其稿件,同时有助于缓解日益加大的审查负担。我们的数据和代码均可在 https://anonymous.4open.science/r/ReviewBench_anon/ 获取。
引用
@article{arxiv.2505.07920,
title = {Re2: A Consistency-ensured Dataset for Full-stage Peer Review and Multi-turn Rebuttal Discussions},
author = {Daoze Zhang and Zhijian Bao and Sihang Du and Zhiyi Zhao and Kuangling Zhang and Dezheng Bao and Yang Yang},
journal= {arXiv preprint arXiv:2505.07920},
year = {2026}
}
备注
2 figures, 5 tables