中文

我们是否在真正创新?对AI研究论文原创性的定性与定量研究

计算与语言 2026-05-28 v3

摘要

评估AI研究的原创性, arguably是同行评审中最重要却最不可靠的步骤。评审员对原创性的判断往往缺乏透明度、一致性,且依赖于对先前工作的比较,而这些比较常常不完整。本文基于超过10万篇来自领先AI venue的同行评审报告,开展了规模化、数据驱动的定性与定量分析,涵盖AI领域快速发展的时期。我们利用结构化的语义检索先前工作,以及专家评审评估中嵌入的信号,系统性地刻画了原创性在实际中的感知方式,并识别出最强烈影响新颖度判断的关键维度。我们的分析构建了细粒度、以证据为依据的框架,为作者和评审员提供了可操作的洞察,了解原创性如何被评估。此外,我们评估了当前大型语言模型(LLM)代理在评估原创性方面的可靠性。我们发现,这些模型倾向于系统性地高估新颖度,难以检测概念性抄袭,尤其在存在改写的情况下。我们在https://anonymous.4open.science/r/Novelty-Reviewer-365C/发布了数据集、训练模型及代码。

关键词

引用

@article{arxiv.2602.06054,
  title  = {Are We Truly Innovating? A Qualitative and Quantitative Study of Originality in AI Research Papers},
  author = {Abeer Mostafa and Thi Huyen Nguyen and Zahra Ahmadi},
  journal= {arXiv preprint arXiv:2602.06054},
  year   = {2026}
}