中文

面向旋转不变运动的基于目标的批量强化学习

机器学习 2020-04-20 v1 人工智能 机器学习

摘要

我们提出了一种新颖的方法,用于在批量强化学习(RL)设定中学习基于目标的运动策略。批量数据由一个非基于目标的策略收集。对于运动任务,这转化为使用智能体为沿一个方向直行而学得的策略来收集数据,并利用该数据学习一个基于目标的策略,使智能体能够向任意方向行走。所使用的数据收集策略应对智能体所面对的方向具有不变性,即无论其初始朝向如何,智能体都应采取相同的动作向前行走。我们利用这一性质,通过两个关键思想来学习基于目标的策略:(1)通过在不同方向上以相同动作生成轨迹来增强数据;(2)使用孪生框架学习一个编码器,强制这些旋转轨迹之间的不变性。我们证明,我们的方法在Ant、Humanoid和Minitaur等三维运动智能体上优于现有的RL算法。

关键词

引用

@article{arxiv.2004.08356,
  title  = {Goal-conditioned Batch Reinforcement Learning for Rotation Invariant Locomotion},
  author = {Aditi Mavalankar},
  journal= {arXiv preprint arXiv:2004.08356},
  year   = {2020}
}

备注

Accepted to the BeTR-RL workshop at ICLR 2020. Link to code: https://github.com/aditimavalankar/gc-batch-rl-locomotion