学习用于安全跌倒的统一控制策略
机器人学
2017-04-21 v2 人工智能
机器学习
摘要
能够安全跌倒是仿人机器人执行跑步和跳跃等高动态任务的必备运动技能。我们提出了一种新方法来学习使跌倒期间最大冲量最小化的策略。该优化同时求解离散接触规划问题和连续最优控制问题。策略训练完成后,能够计算出下一个最优接触身体部位(例如左脚、右脚或手)、接触位置与时机,以及所需的关节驱动。我们将该策略表示为混合 actor-critic 神经网络,由 n 个控制策略及相应的值函数组成。每对 actor-critic 与 n 个可能的接触身体部位之一相关联。在执行阶段,对应最高值函数的策略将被执行,同时相关联的身体部位将成为下一个与地面接触的部位。通过这种混合 actor-critic 架构,离散接触序列规划通过选择最优 critic 来求解,而连续控制问题则通过优化 actor 来求解。我们表明,我们的策略能够获得与使用动态规划递归搜索动作空间相当、有时甚至更高的奖励,同时在在线执行阶段享有50至400倍的速度提升。
引用
@article{arxiv.1703.02905,
title = {Learning a Unified Control Policy for Safe Falling},
author = {Visak CV Kumar and Sehoon Ha and C Karen Liu},
journal= {arXiv preprint arXiv:1703.02905},
year = {2017}
}