为何大语言模型尚未成为科学家:来自四次自主研究尝试的经验教训
机器学习
2026-01-08 v1 人工智能
摘要
我们报告了四次使用由六个大语言模型代理构成的管道进行自主生成机器学习研究论文的案例研究。其中三次尝试在实施或评估阶段失败。唯一一次完成整个管道并被接受至Agents4Science 2025——该场所为人工智能系统首位作者所设的实验性新兴会议,经过人类及多AI审稿。通过这些尝试,我们记录了六种反复出现的失败模式:对训练数据默认值的偏好、在执行压力下的实现漂移、跨长期任务的记忆与上下文衰减、对显著失败的过度兴奋声明成功、对领域智力的不足以及对实验设计的薄弱科学品味。我们通过讨论四项更健壮AI科学家系统的设计原则、自主科学发现的意义,随后在https://github.com/Lossfunk/ai-scientist-artefacts-v1公开所有提示词、制品与输出。
引用
@article{arxiv.2601.03315,
title = {Why LLMs Aren't Scientists Yet: Lessons from Four Autonomous Research Attempts},
author = {Dhruv Trehan and Paras Chopra},
journal= {arXiv preprint arXiv:2601.03315},
year = {2026}
}