FactReview:基于执行证据的声明验证式同行评审系统
人工智能
2026-05-28 v3 机器学习
摘要
基于大语言模型的评审系统通常仅以手稿为输入,使文献和代码声明难以验证。我们提出 FactReview,一个从中提取评审相关声明、以文献为依据、并在代码可用时在固定修复预算下执行所发布的制品以审计实证声明的系统。跨35篇机器学习论文和463项主要声明,FactReview 覆盖84%的声明。在证据感知评语表下,其评审得分5.86/5于整体质量,0.7高于 DeepReview-v2,1.5高于匹配的 OpenReview 评论。去除执行证据会改变17%的声明状态,是其他任何单一证据来源的影响最大。我们还进行了评审辅助研究,表明 FactReview 在58%的平均评审时间缩减,同时将基准声明覆盖率从87%提升至99%。我们认为,大语言模型评审者应审计实证声明,而非作出接受或拒稿决定。代码已公开于: https://github.com/DEFENSE-SEU/FactReview。
引用
@article{arxiv.2604.04074,
title = {FactReview: Evidence-Grounded Peer Review with Execution-Based Claim Verification},
author = {Ling Yue and Chaoqian Ouyang and Hang Xu and Ruijun Huang and Yuchen Liu and Libin Zheng and Wei Liu and Shaowu Pan and Shimin Di and Min-Ling Zhang},
journal= {arXiv preprint arXiv:2604.04074},
year = {2026}
}