高效复用先前经验以改进真实环境中的策略
机器人学
2014-05-13 v1
摘要
本研究表明,可以利用真实机器人的先前经验高效地改进运动策略。强化学习 (RL) 正成为一种通过试错获取非线性最优策略的流行方法。然而,将 RL 应用于真实机器人控制被认为非常困难,因为它通常需要大量的学习试验。由于需要不切实际的时间且真实系统的耐久性有限,此类试验无法在真实环境中执行。因此,在本研究中,我们提议不使用大量学习试验,而是使用最近开发的 RL 算法——重要性加权 PGPE,该算法使机器人能够高效地复用先前采样的数据来改进其策略参数。我们将重要性加权 PGPE 应用于我们的真实人形机器人 CB-i,并表明它可以在没有任何任务先验知识或任何精心设计的初始轨迹的情况下,在真实环境中学习目标到达运动和倒立摆摆起运动。
引用
@article{arxiv.1405.2406,
title = {Efficient Reuse of Previous Experiences to Improve Policies in Real Environment},
author = {Norikazu Sugimoto and Voot Tangkaratt and Thijs Wensveen and Tingting Zhao and Masashi Sugiyama and Jun Morimoto},
journal= {arXiv preprint arXiv:1405.2406},
year = {2014}
}
备注
14 pages, 9 figures, http://www.cns.atr.jp/bri/en/. arXiv admin note: substantial text overlap with arXiv:1301.3966