中文

大型语言模型能否解锁新颖的科学研究思路?

计算与语言 2025-10-28 v2 人工智能 计算机与社会 人机交互 机器学习

摘要

大型语言模型(LLMs)和公开可用的 ChatGPT 的广泛采用,标志着人工智能(AI)融入人们日常生活的一个重要转折点。本研究探讨了大型语言模型(LLMs)从科学论文中生成未来研究思路的能力。与摘要或翻译等任务不同,思路生成缺乏明确定义的参考集或结构,使得人工评估成为默认标准。然而,在这种情境下,人工评估极具挑战性,即:它需要大量的领域专业知识、对论文的上下文理解以及对当前研究格局的认识。这使得评估耗时、昂贵且从根本上不可扩展,尤其是在新 LLMs 快速发布的当下。目前,还没有专门为此任务设计的自动化评估指标。为了弥补这一空白,我们提出了两个自动化评估指标:思路对齐分数(IAScore)和思路独特性指数。我们进一步进行了人工评估,以评估生成的未来研究思路的新颖性、相关性和可行性。这项研究为 LLMs 在思路生成中不断演变的角色提供了见解,突出了其能力和局限性。我们的工作为评估和利用语言模型生成未来研究思路的持续努力做出了贡献。我们将公开数据集和代码。

关键词

引用

@article{arxiv.2409.06185,
  title  = {Can Large Language Models Unlock Novel Scientific Research Ideas?},
  author = {Sandeep Kumar and Tirthankar Ghosal and Vinayak Goyal and Asif Ekbal},
  journal= {arXiv preprint arXiv:2409.06185},
  year   = {2025}
}

备注

EMNLP 2025 (Main)