中文

用于技能无监督发现的变分课程强化学习

机器学习 2023-10-31 v1 人工智能 机器人学

摘要

基于互信息的强化学习(RL)已被提出作为一种有前景的框架,通过互信息(MI)最大化或变分赋能(variational empowerment)在无任务导向奖励函数的情况下自主获取复杂技能。然而,学习复杂技能仍具挑战性,因为技能训练的顺序会极大影响样本效率。受此启发,我们将变分赋能重新表述为带内在奖励函数的目标条件RL中的课程学习,称之为变分课程RL(VCRL)。从这一视角出发,我们提出一种基于信息论的无监督技能发现新方法,称为价值不确定性变分课程(VUVC)。我们证明,在正则条件下,与均匀课程相比,VUVC加速了已访问状态熵的增加。我们在复杂导航与机器人操作任务上从样本效率和状态覆盖速度方面验证了方法的有效性。我们还展示了我们的方法发现的技能在零样本设置下成功完成真实世界机器人导航任务,且将这些技能与全局规划器结合进一步提升了性能。

关键词

引用

@article{arxiv.2310.19424,
  title  = {Variational Curriculum Reinforcement Learning for Unsupervised Discovery of Skills},
  author = {Seongun Kim and Kyowoon Lee and Jaesik Choi},
  journal= {arXiv preprint arXiv:2310.19424},
  year   = {2023}
}

备注

ICML 2023. First two authors contributed equally. Code at https://github.com/seongun-kim/vcrl