中文

这想法是新颖的?用于研究想法判断的自动基准

计算与语言 2026-03-12 v1 人工智能

摘要

判断研究想法的新颖性对于推动科学进步至关重要,这有助于识别未被探索的方向,并确保贡献而非仅是对现有知识的轻微延续。然而,鉴于科学文献的指数级增长,通过文献综述手动判断研究想法的新颖性已变得费时、主观且难以大规模实现。因此,最近的努力提出了自动化的研究想法新颖性判断方法。然而,这些方法的评估仍大体保持不一致,通常基于非标准化的人类评估,阻碍了大规模、可比的评估。为此,我们引入RINoBench,这是首个用于大规模评估研究想法新颖性判断的综合基准。它包含1,381个由人类专家从事判断的研究想法,以及九个自动化评估指标,用于评估基于评分标准的新颖性分数以及新颖性判断的文本论证。使用该基准,我们评估了多个最先进的大型语言模型(LLM)在判断研究想法新颖性方面的能力。我们的发现表明,虽然LLM生成的推理与人类论述密切相关,但这种一致性并不可靠地转化为准确的新颖性判断——即使是领先的具有推理能力的模型,也与人类黄金标准判断存在显著差异。数据和代码均可在:https://github.com/TimSchopf/RINoBench 获取。

关键词

引用

@article{arxiv.2603.10303,
  title  = {Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas},
  author = {Tim Schopf and Michael Färber},
  journal= {arXiv preprint arXiv:2603.10303},
  year   = {2026}
}

备注

Accepted to LREC 2026