中文

E3:面向自动化研究批判的issue级后测试

计算与语言 2026-05-27 v1 人工智能

摘要

我们提出E3,一个自动化审稿助手,通过识别研究论文中的决策相关技术性关切来增强审稿人和工程团队。对于每个关切,E3报告其性质、位置、对贡献的影响以及需要的分析或证据,涵盖不支持的主张、缺失的消除实验、弱基线、隐藏假设、有效性威胁及泄漏风险。为避免污染混淆的评估,我们采用issue级后测试协议:语料库限于训练截止日期之后的论文,对于每篇论文,仅观察匿名审稿意见的元评判家为每个issue-source对标记为Caught、Partial或Missed。应用于100篇ICLR 2026论文和4598项被判定的issue行,对E3与ICLR人工审稿、基于GPT-5.4和Claude-Opus-4-6构建的两个prompt匹配LLM基线进行比较,元评判使用GPT-5.5。E3在每个综合指标上实现最高召回率。部分包容召回率达90.2%,相较于GPT高出15.5个百分点,相较于Claude高出17.1个百分点,相较于人工审稿高出29.2个百分点,严格召回率保持排序稳定在65.8%。对于人工审稿提出的关切,E3恢复89.6%;对于人工审稿遗漏的关切,E3敞开1635个额外行,领先次佳来源406行。语料库、基线提示、评判提示模板及评估代码已公开。

关键词

引用

@article{arxiv.2605.27072,
  title  = {E3: Issue-Level Backtesting for Automated Research Critique},
  author = {Yashwardhan Chaudhuri and Sanyam Jain and Paridhi Mundra},
  journal= {arXiv preprint arXiv:2605.27072},
  year   = {2026}
}