中文

LLM是贪婪代理人:强化学习微调对决策能力的影响

机器学习 2025-04-23 v1 人工智能

摘要

大型语言模型(LLM)的成功激发了对各种代理人应用的浓厚兴趣。一个关键假设是,LLM能够利用常识和链式思维(CoT)推理,有效地探索并解决复杂领域的问题。然而,LLM代理人被发现在探索方面存在亚优势,以及knowing-doing gap,即无法有效地行动于模型中存在的知识。本文我们系统性地研究了为何LLM在决策情境下表现不佳的原因。特别是,我们紧密审查了三种常见的失败模式:贪婪主义、频率偏差以及knowing-doing gap。我们通过在自生成CoT理由上进行强化学习微调来缓解这些短板。我们的实验覆盖多臂老虎机、情境老虎机和井字棋,表明强化学习微调通过增加探索和缩小knowing-doing gap来提升LLM的决策能力。最后,我们研究了经典探索机制(如ϵ\epsilon-贪婪)以及LLM特有的做法(如自我纠正和自我一致性),以实现更有效的LLM决策微调。

关键词

引用

@article{arxiv.2504.16078,
  title  = {LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities},
  author = {Thomas Schmied and Jörg Bornschein and Jordi Grau-Moya and Markus Wulfmeier and Razvan Pascanu},
  journal= {arXiv preprint arXiv:2504.16078},
  year   = {2025}
}