这想法是新颖的?用于研究想法判断的自动基准
计算与语言
2026-03-12 v1 人工智能
摘要
判断研究想法的新颖性对于推动科学进步至关重要,这有助于识别未被探索的方向,并确保贡献而非仅是对现有知识的轻微延续。然而,鉴于科学文献的指数级增长,通过文献综述手动判断研究想法的新颖性已变得费时、主观且难以大规模实现。因此,最近的努力提出了自动化的研究想法新颖性判断方法。然而,这些方法的评估仍大体保持不一致,通常基于非标准化的人类评估,阻碍了大规模、可比的评估。为此,我们引入RINoBench,这是首个用于大规模评估研究想法新颖性判断的综合基准。它包含1,381个由人类专家从事判断的研究想法,以及九个自动化评估指标,用于评估基于评分标准的新颖性分数以及新颖性判断的文本论证。使用该基准,我们评估了多个最先进的大型语言模型(LLM)在判断研究想法新颖性方面的能力。我们的发现表明,虽然LLM生成的推理与人类论述密切相关,但这种一致性并不可靠地转化为准确的新颖性判断——即使是领先的具有推理能力的模型,也与人类黄金标准判断存在显著差异。数据和代码均可在:https://github.com/TimSchopf/RINoBench 获取。
引用
@article{arxiv.2603.10303,
title = {Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas},
author = {Tim Schopf and Michael Färber},
journal= {arXiv preprint arXiv:2603.10303},
year = {2026}
}
备注
Accepted to LREC 2026