中文

用于反应式运动生成与强化学习的可组合能量策略

机器人学 2021-05-12 v1 机器学习

摘要

反应式运动生成问题通常通过将对策略的贡献求和来计算动作。然而,这些策略彼此独立,因此在将它们的贡献相加时可能产生冲突行为。我们提出可组合能量策略(CEP),一种用于模块化反应式运动生成的新框架。CEP 通过对一组随机策略的乘积进行优化来计算控制动作。该策略乘积将为满足所有组成部分的动作提供高概率,而为其他动作提供低概率。对策略乘积进行优化避免了策略间冲突行为的有害影响,从而选择一个满足所有目标的动作。此外,我们展示了 CEP 自然适应强化学习问题,使我们能够以分层方式将任意分布作为先验进行集成,从多模态分布到非光滑分布,并据此学习新策略。

关键词

引用

@article{arxiv.2105.04962,
  title  = {Composable Energy Policies for Reactive Motion Generation and Reinforcement Learning},
  author = {Julen Urain and Anqi Li and Puze Liu and Carlo D'Eramo and Jan Peters},
  journal= {arXiv preprint arXiv:2105.04962},
  year   = {2021}
}

备注

8 pages, RSS 2021, Robotics: Science and Systems 2021