中文

利用不同类型的探索从同一目标学习行走与小跑

机器学习 2019-04-30 v1 机器人学 机器学习

摘要

在四足步态学习中,常用于扩展高维连续动作空间的策略搜索方法被普遍使用。在大多数方法中,有必要引入关于步态的先验知识以限制策略的高度非凸搜索空间。本工作中,我们提出一种新方法,在高斯搜索分布的初始协方差上编码所需步态的对称性质,以实现策略性探索。利用基于片段的似然比策略梯度和相对熵策略搜索,我们在模拟四足机器人上学习了行走与小跑步态。将这些步态与由初始化对角协方差矩阵学到的随机步态进行比较,我们表明性能可得到显著提升。

关键词

引用

@article{arxiv.1904.12336,
  title  = {Learning walk and trot from the same objective using different types of exploration},
  author = {Zinan Liu and Kai Ploeger and Svenja Stark and Elmar Rueckert and Jan Peters},
  journal= {arXiv preprint arXiv:1904.12336},
  year   = {2019}
}