LVIS:从值函数区间学习以实现接触感知的机器人控制器
机器人学
2018-09-18 v1
摘要
引导策略搜索是训练高维系统控制器的一种流行方法,但它存在一些缺陷。非凸轨迹优化存在局部极小,而最优策略本身的非唯一性可能意味着独立优化的样本并不能描述出一个可用于训练的连贯策略。我们提出 LVIS,它通过全局混合整数优化规避局部极小问题,并通过学习最优值函数(或代价到达到)而非最优策略来规避非唯一性问题。为避免将混合整数规划求解至完全全局最优的高昂代价,我们仅对其进行部分求解,从分支定界算法的提前终止中提取包含真实代价到达到的区间。这些区间样本被用于弱监督训练一个逼近真实代价到达到的神经网络。在线时,我们将学习到的值函数用作一步模型预测控制器的终端代价,并通过一个小型混合整数优化求解该控制器。我们在带墙的车杆系统和一个平面人形机器人模型上演示了 LVIS 方法,并表明它可应用于反馈控制中一个本质困难的问题——接触控制。
引用
@article{arxiv.1809.05802,
title = {LVIS: Learning from Value Function Intervals for Contact-Aware Robot Controllers},
author = {Robin Deits and Twan Koolen and Russ Tedrake},
journal= {arXiv preprint arXiv:1809.05802},
year = {2018}
}
备注
7 pages, 8 figures. Submitted to the 2019 IEEE International Conference on Robotics and Automation (ICRA 2019)