LLM是贪婪代理人:强化学习微调对决策能力的影响
机器学习
2025-04-23 v1 人工智能
摘要
大型语言模型(LLM)的成功激发了对各种代理人应用的浓厚兴趣。一个关键假设是,LLM能够利用常识和链式思维(CoT)推理,有效地探索并解决复杂领域的问题。然而,LLM代理人被发现在探索方面存在亚优势,以及knowing-doing gap,即无法有效地行动于模型中存在的知识。本文我们系统性地研究了为何LLM在决策情境下表现不佳的原因。特别是,我们紧密审查了三种常见的失败模式:贪婪主义、频率偏差以及knowing-doing gap。我们通过在自生成CoT理由上进行强化学习微调来缓解这些短板。我们的实验覆盖多臂老虎机、情境老虎机和井字棋,表明强化学习微调通过增加探索和缩小knowing-doing gap来提升LLM的决策能力。最后,我们研究了经典探索机制(如-贪婪)以及LLM特有的做法(如自我纠正和自我一致性),以实现更有效的LLM决策微调。
引用
@article{arxiv.2504.16078,
title = {LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities},
author = {Thomas Schmied and Jörg Bornschein and Jordi Grau-Moya and Markus Wulfmeier and Razvan Pascanu},
journal= {arXiv preprint arXiv:2504.16078},
year = {2025}
}