中文

复杂环境中增强强化学习综述:来自人类与 LLM 反馈的启示

机器学习 2024-11-21 v1

摘要

强化学习(RL)是机器学习中的活跃领域之一,在应对现实世界挑战方面展现出显著潜力。尽管前景广阔,该方法仍遭遇了阻碍其实现最佳性能的问题与挑战。特别是,这些方法在导航环境以及处理具有大观测空间的任务时缺乏良好的性能,往往导致样本效率低下和漫长的学习时间。这一问题通常被称为维度灾难,使 RL 智能体的决策复杂化,需要在注意力与决策之间进行仔细的平衡。当 RL 智能体辅以人类或大型语言模型(LLM)的反馈时,可能会表现出弹性和适应性,从而带来性能的提升和学习的加速。这种通过包括自然语言在内的各种模态或粒度传达的反馈,作为 RL 智能体的指导,帮助其辨别相关的环境线索并优化决策过程。在这篇综述论文中,我们主要关注两个层面的问题:首先,我们关注人类或 LLM 的辅助,研究这些实体如何与 RL 智能体协作以促进最优行为并加速学习;其次,我们深入探讨致力于解决以大观测空间为特征的环境复杂性的研究论文。

关键词

引用

@article{arxiv.2411.13410,
  title  = {A Survey On Enhancing Reinforcement Learning in Complex Environments: Insights from Human and LLM Feedback},
  author = {Alireza Rashidi Laleh and Majid Nili Ahmadabadi},
  journal= {arXiv preprint arXiv:2411.13410},
  year   = {2024}
}