大语言模型能否生成新颖的研究思想?基于100多名NLP研究人员的人类实验
计算与语言
2024-09-09 v1 人工智能
计算机与社会
人机交互
机器学习
摘要
近期大语言模型(LLM)的快速发展,使人们对其加速科学发现的潜力充满期待,越来越多的工作提出了能够自主生成和验证新想法的研究代理。尽管如此,尚无评估表明LLM系统能够完成产生新颖、专家水平想法的第一步,更不用说完成整个研究过程。我们通过建立一个实验设计来评估研究想法生成,控制混杂因素,并对 expert NLP 研究人员与 LLM 思想生成代理进行首次头盲比较。通过招募超过100名 NLP 研究人员撰写新想法并对 LLM 与人类想法进行盲审,我们获得了关于当前 LLM 在研究构想方面能力的首个统计显著结论:我们发现 LLM 生成的想法在新颖性上(p < 0.05)被认为比人类专家想法更新颖,而在可行性方面略弱。深入研究我们的代理基线,我们确定了构建和评估研究代理的开放问题,包括 LLM 自评估失败以及其缺乏生成多样性。最后,我们承认即便是专家对新颖性的判断也困难重重,并提出了一种端到端的研究设计,招募研究人员执行这些想法以构建完整项目,从而研究这些新颖性和可行性判断是否导致有意义的研究结果差异。
引用
@article{arxiv.2409.04109,
title = {Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers},
author = {Chenglei Si and Diyi Yang and Tatsunori Hashimoto},
journal= {arXiv preprint arXiv:2409.04109},
year = {2024}
}
备注
main paper is 20 pages