AInstein:仅凭参数化内存,LLM 能否解决研究问题?
人工智能
2026-04-29 v2
摘要
大型语言模型仅凭参数化知识(无需微调、检索或其他外部辅助)能否解决人工智能研究问题?我们提出 AInstein 框架,用于测试 LLM 代理能否通过迭代批判循环生成并细化解决研究问题的方案。我们对 20 位领域专家进行盲测,使用保存的 ICLR 2026 题目验证了我们的自动化指标,然后将其扩展到 1214 篇 ICLR 2025 论文,采用 LLM 作为评判者的范式进行规模化测试。两种指标捕捉性能的互补方面:成功率(解答是否解决问题?)和复原率(是否与已发布方法一致?)。LLM 在超过 70% 的问题上取得成功,但严格复原已发布方案的比例不足 19%,表明其具有真正的问题解决能力而非仅靠关联记忆。然而,这一能力存在明确限制:模型在熟悉的方法领域表现良好,但在需要跨域类比迁移的解决方案时会失败,我们称之为参数化知识边界。在 ResearchPlanGen 数据集(2645 个问题)上,我们的无训练迭代细化策略与强化学习微调相当,criteria-coverage 分析确切界定了仅凭测试时细化可实现的上限。综上,这些发现描绘了 LLM 作为自主科学问题解决者的能力与限制。
引用
@article{arxiv.2510.05432,
title = {AInstein: Can LLMs Solve Research Problems From Parametric Memory Alone?},
author = {Shambhavi Mishra and Gaurav Sahu and Marco Pedersoli and Laurent Charlin and Jose Dolz and Christopher Pal},
journal= {arXiv preprint arXiv:2510.05432},
year = {2026}
}