中文

关注盲点:一种针对 LLM 评审的焦点级评估框架

计算与语言 2025-11-10 v4

摘要

同行评审是科学进步的基石,但审稿人短缺和日益增长的工作量正使其不堪重负。大型语言模型 (LLM) 如今可以自动起草评审,但要确定 LLM 生成的评审是否值得信赖,需要进行系统评估。研究人员曾在表层(例如 BLEU 和 ROUGE)或内容层(例如具体性和事实准确性)评估 LLM 评审。然而,LLM 生成的评审是否关注了人类专家所权衡的同样关键的面——即最终驱动接受或拒绝决定的优缺点——仍不确定。我们引入了一种焦点级评估框架,将焦点操作化为论文评审中跨预定义面的注意力归一化分布。基于该框架,我们开发了一个自动的焦点级评估流水线,基于两组面:目标(例如问题、方法和实验)与方面(例如有效性、清晰度和新颖性),利用了来自 OpenReview 的 676 篇论文评审 (https://figshare.com/s/d5adf26c802527dd0f62),其中包含从人类专家处识别出的 3,657 个优缺点。LLM 与人类专家之间的焦点分布比较表明,现成的 LLM 在批评论文时,始终更偏向于审查技术有效性,同时显著忽略了新颖性评估。

关键词

引用

@article{arxiv.2502.17086,
  title  = {Mind the Blind Spots: A Focus-Level Evaluation Framework for LLM Reviews},
  author = {Hyungyu Shin and Jingyu Tang and Yoonjoo Lee and Nayoung Kim and Hyunseung Lim and Ji Yong Cho and Hwajung Hong and Moontae Lee and Juho Kim},
  journal= {arXiv preprint arXiv:2502.17086},
  year   = {2025}
}

备注

EMNLP 2025 Oral