利用不同类型的探索从同一目标学习行走与小跑
机器学习
2019-04-30 v1 机器人学
机器学习
摘要
在四足步态学习中,常用于扩展高维连续动作空间的策略搜索方法被普遍使用。在大多数方法中,有必要引入关于步态的先验知识以限制策略的高度非凸搜索空间。本工作中,我们提出一种新方法,在高斯搜索分布的初始协方差上编码所需步态的对称性质,以实现策略性探索。利用基于片段的似然比策略梯度和相对熵策略搜索,我们在模拟四足机器人上学习了行走与小跑步态。将这些步态与由初始化对角协方差矩阵学到的随机步态进行比较,我们表明性能可得到显著提升。
引用
@article{arxiv.1904.12336,
title = {Learning walk and trot from the same objective using different types of exploration},
author = {Zinan Liu and Kai Ploeger and Svenja Stark and Elmar Rueckert and Jan Peters},
journal= {arXiv preprint arXiv:1904.12336},
year = {2019}
}