中文

LaMOuR:利用语言模型实现强化学习中的离群分布恢复

机器人学 2025-03-31 v5 人工智能

摘要

深度强化学习 (DRL) 在机器人控制中展现出强大的性能,但对离群分布 (OOD) 状态仍高度敏感,常导致不可靠的动作和任务失败。虽然先前的方法关注最小化或防止 OOD 事件的发生,但很少关注代理遇到此类状态后的恢复。尽管最新的研究尝试通过引导代理返回 in-distribution 状态来解决此问题,但其依赖不确定性估计在复杂环境中限制了可扩展性。为克服这一限制,我们引入 Language Models for Out-of-Distribution Recovery (LaMOuR),该模型无需依赖不确定性估计即可实现恢复学习。LaMOuR 生成稠密奖励代码以指导代理返回能够成功执行其原始任务的状态,充分利用 LVLMs 在图像描述、逻辑推理和代码生成方面的能力。实验结果表明,LaMOuR 在多样化的 locomotion 任务中显著提升了恢复效率,即使在人类 locomotion 和移动操作等复杂环境中也能有效泛化,其中现有方法难以应对。代码和补充材料已公开于 https://lamour-rl.github.io/。

关键词

引用

@article{arxiv.2503.17125,
  title  = {LaMOuR: Leveraging Language Models for Out-of-Distribution Recovery in Reinforcement Learning},
  author = {Chan Kim and Seung-Woo Seo and Seong-Woo Kim},
  journal= {arXiv preprint arXiv:2503.17125},
  year   = {2025}
}

备注

14 pages, 16 figures