超越“创新性不足”:LLM 辅助反馈丰富化学术评论
计算与语言
2026-01-21 v4
摘要
新颖性评估是同行评审中的核心却不够深入的议题,尤其是在像 NLP 这样的高流量领域,审稿人容量日益受限。我们提出一种结构化方法,用于自动化新颖性评估,通过建模专家审稿人行为的三个阶段:从提交物中提取内容、检索和综合相关工作、以及进行结构化比较以进行基于证据的评估。我们的方法受大规模人类书写新颖性评论分析的启发,捕捉关键模式,如独立的索赔验证和情境推理。在182篇 ICLR 2025 提交论文上进行评估,采用人工标注的审稿人新颖性评估,该方法实现了86.5%的人类推理一致性和75.3%的新颖性结论一致性——显著优于现有的基于 LLM 的基线方法。该方法产生详尽的、具文献背景的分析,并在传统的即兴审稿人判断上提高了一致性。这些结果凸显了结构化 LLM 辅助方法在支持更严谨和透明的同行评审中的潜力,而不会取代人类专家知识。数据和代码均已公开。
引用
@article{arxiv.2508.10795,
title = {Beyond "Not Novel Enough": Enriching Scholarly Critique with LLM-Assisted Feedback},
author = {Osama Mohammed Afzal and Preslav Nakov and Tom Hope and Iryna Gurevych},
journal= {arXiv preprint arXiv:2508.10795},
year = {2026}
}