中文

评估大语言模型在科学思维能力上的表现:基于最小上下文的科学想法生成

计算与语言 2026-02-24 v4 人工智能

摘要

尽管大型语言模型在科学任务中展现出惊人的能力,例如准确提取论文中的关键发现或生成连贯的实验程序,但现有的评估基准主要使用丰富的上下文输入来评估性能。我们引入 LiveIdeaBench,这是一个综合性基准,用于评估大语言模型通过单关键词提示来衡量其科学想法生成中的发散思维能力。基于吉尔福斯的创造力理论,我们的基准运用一套动态的领先大语言模型,对生成的想法在五个关键维度上进行评估:原创性、可行性、流畅性、灵活性和清晰性。通过对超过40个顶尖模型进行大规模实验,涵盖1180个关键词和22个科学领域,我们发现我们基准衡量的科学想法生成能力,与一般智力的标准指标预测性差。我们的结果表明,像 QwQ-32B-preview 这样的模型在创造力表现上,能够与顶尖模型如 claude-3.7-sonnet:thinking 相媲美,尽管它们在一般智力分数上存在显著差距。这一发现凸显了为科学想法生成专门评估基准的必要性,并表明增强大语言模型中这些想法生成能力,可能需要不同于用于提高一般问题解决能力的训练策略,从而可能为针对科学过程不同阶段开发的广泛AI工具提供可能性。

关键词

引用

@article{arxiv.2412.17596,
  title  = {Evaluating LLMs' Divergent Thinking Capabilities for Scientific Idea Generation with Minimal Context},
  author = {Kai Ruan and Xuan Wang and Jixiang Hong and Peng Wang and Yang Liu and Hao Sun},
  journal= {arXiv preprint arXiv:2412.17596},
  year   = {2026}
}

备注

Updated manuscript and title