中文

LLM 锯齿状特性解锁科学创造力

人工智能 2026-05-21 v2

摘要

随着人工智能的进步,模型的改进并非均匀进行。相反,进展呈锯齿状,能力在不同任务、领域和模型规模之间增长不均。本文通过科学想法生成的视角,考察了这种动态锯齿状特性。我们引入 SciAidanBench,这是一个用于衡量大型语言模型(LLM)科学创造力的开放性科学问题基准测试。给定科学问题后,模型被要求生成尽可能多的独特且连贯的想法,以总有效响应数量作为创造潜力的衡量标准。我们评估了 19 个基础模型在 8 个提供商(共 30 个变体,包括推理版本)上的表现,发现锯齿状特性在模型之间以及模型内部都有体现。首先,在一般创造力与科学创造力之间的跨任务比较中,一般创造力的改进并不均匀转化为科学创造力,揭示了不同模型之间的能力轮廓差异。其次,在提示词层面,更强的模型并未在所有问题上均匀改进;相反,它们表现出在某些问题上出现创造力高峰,在其他问题上表现有限。第三,在领域层面,单个模型在科学子领域之间展现出不均衡的优势,反映出内部能力轮廓的碎片化特征。最后,我们展示了这种锯齿状特性可以被利用。我们探讨了推理计算、知识汇聚和头脑风暴等机制,以有效组合模型,构建出超过单个模型的元模型集合。我们的结果将锯齿状特性不再视为局限,而是作为一种资源,作为 AI 进步的结构特性,当被理解和利用时,可以放大 LLM 驱动的科学创造力。

关键词

引用

@article{arxiv.2605.10574,
  title  = {LLM Jaggedness Unlocks Scientific Creativity},
  author = {Shray Mathur and J. Anibal Boscoboinik and Esther H. R. Tsai and Kevin G. Yager},
  journal= {arXiv preprint arXiv:2605.10574},
  year   = {2026}
}