中文

PaperAudit-Bench:面向关键自动同行评审的研究论文错误检测基准

计算与语言 2026-01-29 v1

摘要

大型语言模型可以生成流畅的同行评审,但当实质性问题微妙且分布在整篇论文中时,它们的评估往往缺乏足够的关键严谨性。在本文中,我们介绍了PaperAudit-Bench,它包含两个部分:(1) PaperAudit-Dataset,一个错误数据集,涵盖可在单个章节内识别的错误和需要跨章节推理的错误,专为长上下文环境下的受控评估而设计;(2) PaperAudit-Review,一个自动评审框架,它将结构化错误检测与基于证据的评审生成相结合,以支持关键评估。在PaperAudit-Bench上的实验揭示了不同模型和检测深度在错误可检测性上的巨大差异,突出了在长上下文环境下识别此类错误的难度。相对于代表性的自动评审基线,将显式错误检测纳入评审流程会产生系统性更严格和更具区分性的评估,证明了其适用于同行评审。最后,我们展示了该数据集通过SFT和RL支持训练轻量级LLM检测器,从而在降低计算成本的情况下实现有效的错误检测。

关键词

引用

@article{arxiv.2601.19916,
  title  = {PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review},
  author = {Songjun Tu and Yiwen Ma and Jiahao Lin and Qichao Zhang and Xiangyuan Lan and Junfeng. Li and Nan Xu and Linjing Li and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2601.19916},
  year   = {2026}
}