迭代部署提升 LLM 的规划能力
人工智能
2026-01-01 v1 计算与语言
机器学习
摘要
我们表明,大型语言模型(LLM)的迭代部署——即每个模型在前一个模型部署中由用户精心筛选的数据基础上进行微调——会显著改变最终模型的属性。通过在各种规划领域中测试这一机制,我们观察到规划能力得到了显著提升,后续模型显示出通过发现远超初始模型的更长计划来实现的显现性泛化。我们随后提供了理论分析,表明迭代部署实际上是在外部循环(即不是作为有意模型训练的一部分)中实现了强化学习(RL)训练,具有隐式奖励函数。与 RL 的联系有两个重要含义:首先,对于 AI 安全领域来说,由于前一个模型部署所包含的奖励函数并未明确定义,可能对未来模型部署的属性产生意想不到的影响。其次,这里所揭示的机制可被视为对明确 RL 的另一种训练方案,依赖于数据筛选而非明确的奖励。
引用
@article{arxiv.2512.24940,
title = {Iterative Deployment Improves Planning Skills in LLMs},
author = {Augusto B. Corrêa and Yoav Gelberg and Luckeciano C. Melo and Ilia Shumailov and André G. Pereira and Yarin Gal},
journal= {arXiv preprint arXiv:2512.24940},
year = {2026}
}