ReviewGrounder:通过 Rubric 引导、工具集成代理提升评论实质性
计算与语言
2026-04-17 v1 人工智能
摘要
AI 会议提交量的快速增长推动了大语言模型(LLM)用于同行评审支持的深入探索。然而,基于 LLM 的评审常常生成浅薄、公式化的评论,缺乏实质性、以证据为依据的反馈。我们认为,这归因于人类评审中两个关键组件的充分利用不足:显式评审标准和对现有工作的情境性 grounding。为此,我们引入了 REVIEWBENCH—a 一个根据论文特定评审标准(源自官方指南、论文内容和人工书写评论)来评估评论文本的基准。我们进一步提出了 REVIEWGROUNDER—a 一个以 rubric 为指导、集成工具的多代理框架,将评审分解为草拟阶段和 grounding 阶段,通过针对性证据整合来丰富浅层草稿。在 REVIEWBENCH 上的实验表明,REVIEWGROUNDER(使用基于 Phi-4-14B 的草拟器和基于 GPT-OSS-120B 的 grounding 阶段)在与人类判断的一致性和基于 rubric 的评论质量(沿 8 个维度)方面, consistently 超过具有更大/更强 backbone(如 GPT-4.1 和 DeepSeek-R1-670B)的基线。代码请在[此处](https://github.com/EigenTom/ReviewGrounder)访问。
引用
@article{arxiv.2604.14261,
title = {ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents},
author = {Zhuofeng Li and Yi Lu and Dongfu Jiang and Haoxiang Zhang and Yuyang Bai and Chuan Li and Yu Wang and Shuiwang Ji and Jianwen Xie and Yu Zhang},
journal= {arXiv preprint arXiv:2604.14261},
year = {2026}
}