中文

HindSight:通过未来影响评估LLM生成的研究想法

计算与语言 2026-03-18 v2 人工智能 机器学习

摘要

评估AI生成的研究想法通常依赖于LLM裁判或人类评审团——两者均具有主观性且与实际研究影响脱节。我们引入了HindSight,一个时间分割评估框架,通过将生成的想法与真实的未来出版物进行匹配,并按引用影响和会议接收率进行评分来衡量想法质量。使用时间截断点TT,我们将想法生成系统限制在TT之前的文献,然后将其输出与随后30个月内发表的论文进行评估。在10个AI/ML研究主题上的实验揭示了一个显著的脱节:LLM-as-Judge发现检索增强与原始想法生成之间没有显著差异(p=0.584p{=}0.584),而HindSight显示检索增强系统产生的想法评分高出2.5倍(p<0.001p{<}0.001)。此外,HindSight评分与LLM评判的新颖性呈负相关(ρ=0.29\rho{=}{-}0.29p<0.01p{<}0.01),表明LLM系统性地高估了听起来新颖但从未在实际研究中实现的想法。

关键词

引用

@article{arxiv.2603.15164,
  title  = {HindSight: Evaluating LLM-Generated Research Ideas via Future Impact},
  author = {Bo Jiang},
  journal= {arXiv preprint arXiv:2603.15164},
  year   = {2026}
}