DeepReviewer 2.0:可追溯的代理式科学同行评审系统
人工智能
2026-04-14 v1 计算与语言
计算机与社会
摘要
自动化同行评审常被框架化为生成流畅的批评,但评审员和区域主帷需对 judgments 进行审计:关注点适用何处、何种证据支持、何种具体后续措施。DeepReviewer 2.0 是一个受过程控制的代理式评审系统,围绕输出合约构建:其产生带有锚定注释、局部证据和可执行后续动作的可追溯评审包,并仅在满足最低可追溯性和覆盖率预算后导出。具体而言,它首先构建以手稿为中心的 claim-evidence-risk ledger 与验证议程,然后进行议程驱动的检索并在导出门控下撰写带锚定的批评。在 134 份 ICLR 2025 提交稿件中执行三种固定协议,未微调的 196B 参数模型运行 DeepReviewer 2.0 在严格覆盖主要问题方面优于 Gemini-3.1-Pro-preview(37.26% vs. 23.57%),在微平均盲测比较中获胜 71.63%,并在我们所测试的自动系统中名列第一。我们将 DeepReviewer 2.0 定位为辅助工具,而非决策代理,同时指出诸如伦理敏感性检查等仍存 gap。
关键词
引用
@article{arxiv.2604.09590,
title = {DeepReviewer 2.0: A Traceable Agentic System for Auditable Scientific Peer Review},
author = {Yixuan Weng and Minjun Zhu and Qiujie Xie and Zhiyuan Ning and Shichen Li and Panzhong Lu and Zhen Lin and Enhao Gu and Qiyao Sun and Yue Zhang},
journal= {arXiv preprint arXiv:2604.09590},
year = {2026}
}