用于反应式运动生成与强化学习的可组合能量策略
机器人学
2021-05-12 v1 机器学习
摘要
反应式运动生成问题通常通过将对策略的贡献求和来计算动作。然而,这些策略彼此独立,因此在将它们的贡献相加时可能产生冲突行为。我们提出可组合能量策略(CEP),一种用于模块化反应式运动生成的新框架。CEP 通过对一组随机策略的乘积进行优化来计算控制动作。该策略乘积将为满足所有组成部分的动作提供高概率,而为其他动作提供低概率。对策略乘积进行优化避免了策略间冲突行为的有害影响,从而选择一个满足所有目标的动作。此外,我们展示了 CEP 自然适应强化学习问题,使我们能够以分层方式将任意分布作为先验进行集成,从多模态分布到非光滑分布,并据此学习新策略。
引用
@article{arxiv.2105.04962,
title = {Composable Energy Policies for Reactive Motion Generation and Reinforcement Learning},
author = {Julen Urain and Anqi Li and Puze Liu and Carlo D'Eramo and Jan Peters},
journal= {arXiv preprint arXiv:2105.04962},
year = {2021}
}
备注
8 pages, RSS 2021, Robotics: Science and Systems 2021