中文

MENTOR:利用人类反馈和动态距离约束引导分层强化学习

人工智能 2024-11-28 v2 人机交互 机器学习

摘要

分层强化学习(HRL)为具有稀疏奖励的智能体复杂任务提供了一种有前景的解决方案,它使用分层框架将任务分解为子目标并顺序完成。然而,当前方法难以找到合适的子目标以确保稳定的学习过程。如果没有额外的指导,仅依靠探索或启发式方法在大目标空间中确定子目标是不切实际的。为解决这一问题,我们提出了一种结合人类反馈和动态距离约束的通用分层强化学习框架(MENTOR)。MENTOR 充当“导师”,将人类反馈纳入高层策略学习,以寻找更好的子目标。对于低层策略,MENTOR 设计了双重策略分别用于探索 - 利用解耦,以稳定训练。此外,虽然人类可以简单地将任务分解为子目标以指导正确的学习方向,但过难或过易的子目标仍会阻碍下游学习效率。我们提出了动态距离约束(DDC)机制,动态调整可选子目标的空间。因此,MENTOR 能够生成匹配低层策略学习过程、从易到难的子目标。大量实验表明,MENTOR 利用少量人类反馈,在具有稀疏奖励的复杂任务中实现了显著提升。

关键词

引用

@article{arxiv.2402.14244,
  title  = {MENTOR: Guiding Hierarchical Reinforcement Learning with Human Feedback and Dynamic Distance Constraint},
  author = {Xinglin Zhou and Yifu Yuan and Shaofu Yang and Jianye Hao},
  journal= {arXiv preprint arXiv:2402.14244},
  year   = {2024}
}

备注

Accepted for publication in IEEE Transactions on Emerging Topics in Computational Intelligence