LLM 是否能够识别科学研究中的关键局限性?——对 AI 研究论文的系统评估
计算与语言
2025-07-04 v1
摘要
同行评审是科学研究的基本环节,但随着论文数量的不断增长,这一专业化进程正面临日益严峻的挑战。尽管 LLM 在 various 科学任务中显示出前景,但其在识别论文局限性方面以助力同行评审的潜力尚未得到充分考察。我们首先构建了科学研究中局限性类型的全面分类体系,特别聚焦于 AI 领域。基于该分类体系,我们提出 LimitGen——首个全面评估 LLM 能力以支持早期反馈并补充人类同行评审的基准数据集。该基准包含两个子集:LimitGen-Syn 为合成数据集,通过对高质量论文进行受控扰动人工创建;LimitGen-Human 为真实的人类撰写的局限性集合。为提升 LLM 系统识别局限性的能力,我们增强了其文献检索功能,这在以先前科学发现为依据地识别局限性方面至关重要。我们的做法提升了 LLM 系统生成论文局限性的能力,使其能够提供更具体、更具建设性的反馈。
引用
@article{arxiv.2507.02694,
title = {Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers},
author = {Zhijian Xu and Yilun Zhao and Manasi Patwardhan and Lovekesh Vig and Arman Cohan},
journal= {arXiv preprint arXiv:2507.02694},
year = {2025}
}