中文

什么是好的AI评审?面向AI同行评审的关注点级别诊断

人工智能 2026-04-23 v1

摘要

通过结论一致性来评估AI生成的评审被广泛认为是不充分的,然而当前的替代方案很少审查系统识别了哪些关注点、如何对它们进行优先级排序,或者这些优先级是否与形成最终评估的评审理由相一致。我们提出了关注点对齐,这是一种在关注点级别而非仅在结论级别评估AI评审的诊断框架。该框架的核心数据结构是匹配图,它是官方与AI生成的关注点之间的二部对齐,标注了匹配类型、严重性和反驳后处理方式。基于这一产物,我们推导出了一个评估阶梯,从二元准确性逐步上升到关注点检测、结论分层行为、决策感知校准和反驳感知分解。在一项针对四个公共AI评审系统在六种配置下评估的试点研究中,关注点级别分析表明,仅靠检测并不能决定评审质量;校准往往是关键的约束条件。系统检测到了相当比例的官方关注点,但大多数系统将被录论文中25%至55%的关注点标记为决定性的,而在我们的操作化定义下,被录论文中没有任何官方关注点被视为决定性阻碍。相同的总体结论准确性可能掩盖了偏向拒绝的行为与低召回率特征,而较低的全评审假决定性率可能部分反映了关注点稀释,而非经过校准的优先级排序。大多数系统不输出原生的接收/拒绝结论,而从评审语气中推断该结论对方法敏感,这进一步凸显了需要在推断选择上保持稳定的关注点级别诊断。本文的贡献是一个可重用的评估框架,用于审查AI审稿人识别了哪些关注点、如何对其进行加权,以及这些优先级是否与为论文最终评估提供依据的评审理由相一致。

关键词

引用

@article{arxiv.2604.19998,
  title  = {What Makes a Good AI Review? Concern-Level Diagnostics for AI Peer Review},
  author = {Ming Jin},
  journal= {arXiv preprint arXiv:2604.19998},
  year   = {2026}
}