学习操作任务的动作空间比较
机器人学
2019-08-26 v1 机器学习
摘要
设计能够产生精细且精确操作策略的强化学习(RL)问题,需要仔细选择奖励函数、状态和动作空间。许多先前将 RL 应用于操作任务的工作,将动作空间定义为直接关节力矩或用于关节空间比例微分(PD)控制器的参考位置。在实践中,通常可以通过利用基于模型的控制器的附加结构,这些控制器支持精确的定位和操作臂动态响应的控制。在本文中,我们评估了动态操作任务的动作空间选择如何影响样本复杂度以及所学策略的最终质量。我们比较了跨三个任务(销钉插入、锤击和推动)、四个动作空间(力矩、关节 PD、逆动力学和阻抗控制)以及使用两种现代强化学习算法(近端策略优化和软演员-评论家)的学习性能。我们的结果支持了以下假设:为任务空间阻抗控制器学习参考信号,显著减少了在所有任务和算法中实现良好性能所需的样本数量。
引用
@article{arxiv.1908.08659,
title = {A Comparison of Action Spaces for Learning Manipulation Tasks},
author = {Patrick Varin and Lev Grossman and Scott Kuindersma},
journal= {arXiv preprint arXiv:1908.08659},
year = {2019}
}
备注
Accepted as a conference paper at IROS 2019