中文

科学新颖性评估指标的公理化基准

人工智能 2026-04-17 v1 数字图书馆

摘要

对科学论文新颖性的严格评估,即便对于人类科学家来说也颇具挑战性。随着 AI 科学家及 AI 在科学想法生成和论文写作中的参与日益增多,确保这一任务可自动化且可靠地 becoming 至关重要,以免浪费人类注意力和计算资源于已被探索过的想法。然而,由于难以量化新颖性的真实值,现有针对科学论文的新颖性指标通常依赖引文数量或同行评审得分等噪声、受制于混杂信号进行验证。这些代理指标可能将新颖性与影响力、质量或评审偏好混为一谈,从而妨碍我们评估给定指标实际如何评估新颖性。因此,我们提出一种用于科学新颖性指标评估的公理化基准。我们首先定义一组应满足的公理,这些公理植根于人类科学规范和实践之中,然后在三个 AI 研究领域的十个任务上评估现有指标。我们的结果表明,没有任何现有指标能始终满足所有公理,而且各类指标在不同公理上的失效呈系统性差异,这反映了它们的底层架构。此外,我们展示了组合不同架构的指标可在基准上实现一致性改进,采用按公理加权的方法可将最佳单一指标的表现提升至 90.1%,而仅为 71.5%,这表明发展具有不同架构的指标是未来工作的有前景的方向。我们将基准代码作为补充材料公开,以鼓励开发更稳健的科学文献新颖性指标。

关键词

引用

@article{arxiv.2604.15145,
  title  = {An Axiomatic Benchmark for Evaluation of Scientific Novelty Metrics},
  author = {Miri Liu and ChengXiang Zhai},
  journal= {arXiv preprint arXiv:2604.15145},
  year   = {2026}
}

备注

9 pages, 0 figures