同行评审的同行评审:一项随机对照试验及其他实验
数字图书馆
2024-11-08 v2 计算机科学与博弈论
摘要
是否可能可靠地评估同行评审的质量?我们研究这一问题,其由两个主要动机驱动——利用评审的评估质量来激励高质量评审,以及衡量实验中评审质量的变化。我们在机器学习顶级会议 NeurIPS 2022 上开展了一项大规模研究,邀请了(元)评审者和作者对被投稿论文所给的评审进行评估。首先,我们进行了一项 RCT 以检验由评审长度引起的偏差。我们通过添加大量非信息性内容生成加长版评审。对照组参与者评估原始评审,而实验组参与者评估人为加长版本。我们发现加长版评审的质量评分(在统计上显著)高于原始评审。在对观测数据的分析中,我们发现作者对其论文被推荐录用的评审存在正向偏差,即使在控制了评审长度、质量以及每位作者不同论文数量等混杂因素之后依然如此。我们还衡量了同一评审多次评估间的不一致率为 28%–32%,这与 NeurIPS 上论文评审者的不一致率相当。此外,我们使用质量评分的线性模型评估评审评审者的误校准程度,发现其与 NeurIPS 论文评审者误校准的估计值相近。最后,我们估计了围绕如何将单个标准映射到评审质量总体评分的主观意见变异量,发现其大致与论文评审中的变异量相同。我们的结果表明,论文评审中存在的各种问题——不一致性、对无关因素的偏差、误校准、主观性——也出现在评审的评审中。
引用
@article{arxiv.2311.09497,
title = {Peer Reviews of Peer Reviews: A Randomized Controlled Trial and Other Experiments},
author = {Alexander Goldberg and Ivan Stelmakh and Kyunghyun Cho and Alice Oh and Alekh Agarwal and Danielle Belgrave and Nihar B. Shah},
journal= {arXiv preprint arXiv:2311.09497},
year = {2024}
}