中文

使用混合专家的课程强化学习获取多样技能

机器学习 2024-06-11 v2 机器人学

摘要

强化学习 (RL) 是获取高性能策略的强大方法。然而,由于常用的高斯策略参数化,在 RL 中学习多样技能具有挑战性。我们提出了 \textbf{Di}verse \textbf{Skil}l \textbf{L}earning (Di-SkilL),这是一种使用混合专家 学习多样技能的 RL 方法,其中每个专家将一项技能形式化为情境运动原语。Di-SkilL 将每个专家及其关联的上下文分布优化为最大熵目标,激励在相似上下文中学习多样技能。逐专家的上下文分布实现了自动课程学习,允许每个专家专注于其上下文空间中性能最佳的子区域。为了在没有任何关于环境未知上下文概率空间先验知识的情况下克服硬不连续性和多模态性,我们利用基于能量的模型来表示逐专家的上下文分布,并展示了如何使用标准策略梯度目标高效地训练它们。我们在具有挑战性的机器人仿真任务中表明,Di-SkilL 能够学习多样且高性能的技能。

关键词

引用

@article{arxiv.2403.06966,
  title  = {Acquiring Diverse Skills using Curriculum Reinforcement Learning with Mixture of Experts},
  author = {Onur Celik and Aleksandar Taranovic and Gerhard Neumann},
  journal= {arXiv preprint arXiv:2403.06966},
  year   = {2024}
}

备注

International conference on machine learning (ICML)