用于学习多目标、连续动作与状态空间控制器的连续值迭代(CVI)强化学习与虚拟经验回放(IER)
人工智能
2019-08-28 v1
摘要
本文提出一种新颖的无模型强化学习算法,用于在连续动作、状态与目标空间中学习行为。该算法使用非参数估计器逼近最优值函数。其能够在确定性与不确定性环境中高效学习到达多个任意目标。为提升在目标空间中的泛化能力,我们提出一种新颖的样本增广技术。利用这些方法,机器人学习速度更快且所学控制器整体更优。我们使用仿真与一个真实世界的电压控制机器人对所提算法进行基准测试,该机器人在不可观测的笛卡尔任务空间中学习机动。
引用
@article{arxiv.1908.10255,
title = {Continuous Value Iteration (CVI) Reinforcement Learning and Imaginary Experience Replay (IER) for learning multi-goal, continuous action and state space controllers},
author = {Andreas Gerken and Michael Spranger},
journal= {arXiv preprint arXiv:1908.10255},
year = {2019}
}
备注
Published in 2019 International Conference on Robotics and Automation (ICRA) 20-24 May 2019