中文

NovBench:评估大型语言模型在学术论文新颖性评估方面能力的基准

计算与语言 2026-04-14 v1 人工智能 数字图书馆 信息检索

摘要

新颖性是学术出版的核心要求,也是同行评审的核心关注焦点,但日益增长的投稿量正加大对人类评审员的压力。虽然大型语言模型(LLM)包括经过同行评审数据微调的模型在生成评审意见方面显示出前景,但缺乏专门的基准,限制了其系统性评估能力。为填补这一空白,我们引入NovBench,第一个大规模基准,旨�评估LLM能力以支持人类同行评审的新颖性评估。NovBench包含来自某顶级自然语言处理会议的1,684篇论文-评审配对,包括从论文导言中提取的新颖性描述以及对应专家撰写的新颖性评估。我们关注这两个来源,因为导言提供了标准化且明确的新颖性主张,而专家撰写的新颖性评估则是当前人类判断的黄金标准。此外,我们提出四维评估框架(包括相关性、正确性、覆盖范围和清晰度),用于评估LLM生成的新颖性评估质量。对通用模型和专门模型进行大规模实验,不同提示策略下均表明当前模型对科学新颖性理解有限,微调模型常因指令遵循不足而受限。这些发现凸显了针对新颖性理解与指令遵循双重提升所需的针对性微调策略。

关键词

引用

@article{arxiv.2604.11543,
  title  = {NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment},
  author = {Wenqing Wu and Yi Zhao and Yuzhuo Wang and Siyou Li and Juexi Shao and Yunfei Long and Chengzhi Zhang},
  journal= {arXiv preprint arXiv:2604.11543},
  year   = {2026}
}

备注

ACL 2026