中文

使用推理 LLM 审查科学论文的关键问题:基线方法与自动评估

计算与语言 2026-04-03 v3

摘要

大语言模型的最新进展激发了人们在同行评审危机中利用它们来辅助科学出版物同行评审过程的兴趣。然而,让 AI 模型像人类审稿人一样生成完整的评论,可能会加剧对 LLM 生成评论的不负责任的使用,并引发蓄意操纵。作为一种替代方案,我们提出采用 LLM 作为稿件质量检查器。我们引入了几种基线方法和一个可扩展的自动评估框架,使用顶级推理 LLM 作为评判者,以解决招募领域专家进行手动评估的困难。利用从 arXiv 撤回的论文,我们用 2025 年 5 月至 6 月可用的几个领先推理 LLM 验证了我们提出的方法,并评估了它们在识别科学论文中的关键错误和不合理问题方面的性能和 API 成本。o3 在所有模型中以适中的成本表现出最佳的问题识别性能。本文提供了对基于文档的科学理解/推理的见解,并为未来的应用奠定了基础。我们的数据集、代码和模型输出已公开提供。

关键词

引用

@article{arxiv.2505.23824,
  title  = {Reviewing Scientific Papers for Critical Problems With Reasoning LLMs: Baseline Approaches and Automatic Evaluation},
  author = {Tianmai M. Zhang and Neil F. Abernethy},
  journal= {arXiv preprint arXiv:2505.23824},
  year   = {2026}
}

备注

Accepted and presented at NeurIPS 2025 AI for Science Workshop