自动评审者无法检测研究论文中的错误推理:一种新的反事实评估框架
计算与语言
2026-02-02 v2
摘要
大型语言模型(LLM)在加速和支持学术同行评审方面具有巨大潜力,并日益被用作全自动评审生成器(ARG)。然而,潜在的偏差和系统性错误可能对科学完整性构成重大风险;因此,了解最先进 ARG 的具体能力和局限性至关重要。我们聚焦于支撑高质量同行评审的一项核心评审技能:检测错误的研究逻辑。这涉及评估论文结果、解释和主张之间的内部一致性。我们提出了一个全自动的反事实评估框架,在受控条件下隔离并测试该技能。通过对一系列 ARG 方法进行测试,我们发现,与预期相反,研究逻辑中的缺陷对其输出的评审没有显著影响。基于我们的发现,我们为未来的工作提出了三项可操作的建议,并公开了我们的反事实数据集和评估框架。
引用
@article{arxiv.2508.21422,
title = {Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework},
author = {Nils Dycke and Iryna Gurevych},
journal= {arXiv preprint arXiv:2508.21422},
year = {2026}
}
备注
accepted to TACL 2026 (presented at EACL 2026)