HindSight:通过未来影响评估LLM生成的研究想法
计算与语言
2026-03-18 v2 人工智能
机器学习
摘要
评估AI生成的研究想法通常依赖于LLM裁判或人类评审团——两者均具有主观性且与实际研究影响脱节。我们引入了HindSight,一个时间分割评估框架,通过将生成的想法与真实的未来出版物进行匹配,并按引用影响和会议接收率进行评分来衡量想法质量。使用时间截断点,我们将想法生成系统限制在之前的文献,然后将其输出与随后30个月内发表的论文进行评估。在10个AI/ML研究主题上的实验揭示了一个显著的脱节:LLM-as-Judge发现检索增强与原始想法生成之间没有显著差异(),而HindSight显示检索增强系统产生的想法评分高出2.5倍()。此外,HindSight评分与LLM评判的新颖性呈负相关(,),表明LLM系统性地高估了听起来新颖但从未在实际研究中实现的想法。
引用
@article{arxiv.2603.15164,
title = {HindSight: Evaluating LLM-Generated Research Ideas via Future Impact},
author = {Bo Jiang},
journal= {arXiv preprint arXiv:2603.15164},
year = {2026}
}