中文

RbtAct:以反驳为监督的可操作审稿反馈生成

计算与语言 2026-04-29 v2 人工智能

摘要

大型语言模型 (LLM) 正在跨越科学工作流程,包括撰写同行评审报告。然而,许多由 AI 生成的审稿报告都流于表面,缺乏可操作性,使作者无法获得具体可实施的指导,从而激发了本工作的介入。我们提出 RbtAct,旨在生成可操作的审稿反馈,并将现有的同行评审反驳置于核心位置。反驳表明了哪些审稿意见导致具体修订或特定计划,哪些仅被驳斥。基于这一洞见,我们利用反驳作为隐式监督,直接优化反馈生成器以实现可操作性。为支持这一目标,我们提出一种新任务,即视角条件下的段落级审稿反馈生成,该任务要求模型根据完整论文及指定视角(如实验或写作)生成单一聚焦评论。我们构建了一个名为 RMR-75K 的大型数据集,将审稿段落映射到针对它们的反驳段落,包含视角标签和影响类别,以排序作者采纳程度。我们随后对 Llama-3.1-8B-Instruct 模型进行监督式微调,首先在审稿段落上,然后使用由反驳派生的配对进行偏好优化。实验中,针对人类专家和 LLM 评判器的评估显示,我们的方法在可操作性和具体性方面 consistently 获益,同时保持 grounding 和 relevance。

关键词

引用

@article{arxiv.2603.09723,
  title  = {RbtAct: Rebuttal as Supervision for Actionable Review Feedback Generation},
  author = {Sihong Wu and Yiling Ma and Yilun Zhao and Tiansheng Hu and Owen Jiang and Manasi Patwardhan and Arman Cohan},
  journal= {arXiv preprint arXiv:2603.09723},
  year   = {2026}
}

备注

ACL 2026 Findings