中文

超越评分:AI 审稿的综合评估与基准

计算与语言 2026-04-23 v2

摘要

大型语言模型 (LLM) 的快速普及激发了人们对自动同行评审的兴趣;然而,当前的进展受到基准测试的阻碍,这些基准将审稿主要视为评分预测任务。我们认为,审稿的效用在于其文本论证——其论点、问题和批评——而非一个标量分数。为了解决这个问题,我们引入了 Beyond Rating,这是一个整体评估框架,从五个维度评估 AI 审稿人:内容忠实度、论证一致性、焦点一致性、问题建设性和 AI 可能性。值得注意的是,我们提出了一种 Max-Recall 策略以适应有效的专家分歧,并引入了一个经过精心筛选的论文数据集,包含高置信度审稿,经过严格过滤以去除程序性噪声。大量实验表明,虽然传统的 n-gram 指标无法反映人类偏好,但我们提出的以文本为中心的指标——尤其是弱点论证的召回率——与评分准确率强相关。这些发现表明,将 AI 批评焦点与人类专家对齐是可靠自动评分的先决条件,为未来研究提供了稳健的标准。

关键词

引用

@article{arxiv.2604.19502,
  title  = {Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews},
  author = {Bowen Li and Haochen Ma and Yuxin Wang and Jie Yang and Yining Zheng and Xinchi Chen and Xuanjing Huang and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2604.19502},
  year   = {2026}
}

备注

38 pages,8 figures,4 tables