中文

DIAGPaper:通过多智能体推理诊断科学论文中的有效且具体的弱点

人工智能 2026-02-19 v2

摘要

论文弱点识别使用单智能体或多智能体 LLM 已引起日益关注,但现有方法存在关键局限。许多多智能体系统仅在表层模拟人类角色,缺乏导致专家评估纸张不同认知方面的底层准则。此外,先前方法隐含假设所识别的弱点是有效的,忽略了评审偏见、误解以及作者反驳在验证评审质量中的关键作用。最后,大多数系统输出未排序的弱点列表,而不是为用户优先排序最具影响力的问题。在本工作中,我们提出 DIAGPaper,一种新型多智能体框架,通过三个紧密集成的模块来解决这些挑战。定制模块模拟人类定义的评审准则并实例化多个具有准则特定专长的评审智能体。反驳模块引入作者智能体与评审智能体进行结构化辩论,以验证和细化提出的弱点。优先级模块从大规模人类评审实践中学习,以评估已验证弱点的严重程度并向用户呈现最严重的 Top-K 个问题。在两个基准数据集 AAAR 和 ReviewCritique 上的实验表明,DIAGPaper 在生成更有效且更纸张特定的弱点方面显著优于现有方法,同时以面向用户的方式呈现这些弱点。

关键词

引用

@article{arxiv.2601.07611,
  title  = {DIAGPaper: Diagnosing Valid and Specific Weaknesses in Scientific Papers via Multi-Agent Reasoning},
  author = {Zhuoyang Zou and Abolfazl Ansari and Delvin Ce Zhang and Dongwon Lee and Wenpeng Yin},
  journal= {arXiv preprint arXiv:2601.07611},
  year   = {2026}
}