好的、坏的与建设性的:自动度量同行评审对作者的效用
计算与语言
2025-09-23 v3 人工智能
计算机与社会
摘要
为论文作者提供建设性反馈是同行评审的核心组成部分。随着审稿人执行评审的时间越来越少,需要自动化支持系统来确保高评审质量,从而使评审中的反馈对作者有用。为此,我们确定了驱动对作者效用的评审意见(评审中弱点部分的各个要点)的四个关键方面:可操作性、基础与具体性、可验证性和有用性。为了支持评估和开发度量评审意见的模型,我们引入了 RevUtil 数据集。我们收集了 1,430 条人工标注的评审意见,并使用 10k 条合成标注的意见进行训练以扩展数据。合成数据还包含理由,即对评审意见各方面得分的解释。利用 RevUtil 数据集,我们对在这些方面评估评审意见并生成理由的微调模型进行了基准测试。我们的实验表明,这些微调模型与人类的一致性水平与 GPT-4o 等强大的闭源模型相当,在某些情况下甚至超过了它们。我们的分析进一步揭示,机器生成的评审在我们提出的四个方面通常不如人类评审。
引用
@article{arxiv.2509.04484,
title = {The Good, the Bad and the Constructive: Automatically Measuring Peer Review's Utility for Authors},
author = {Abdelrahman Sadallah and Tim Baumgärtner and Iryna Gurevych and Ted Briscoe},
journal= {arXiv preprint arXiv:2509.04484},
year = {2025}
}
备注
EMNLP 2025 Main