ACNMP:基于表征共享的示范学习与强化学习技能迁移及任务外推方法
机器人学
2020-11-10 v3 人工智能
机器学习
摘要
为使机器人具备灵巧技能,一种有效方法是先通过示范学习(LfD)迁移所需技能,再让机器人通过强化学习(RL)自主探索加以改进。本文提出一种新颖的 LfD+RL 框架,即自适应条件神经运动基元(ACNMP),可在新环境中实现高效策略改进,并在不同智能体间有效迁移技能。这是通过利用底层条件神经过程(CNP)模型所学习的潜在表征,并以监督学习(SL)训练模型获取示范轨迹、同时以 RL 发现新轨迹来实现的。通过仿真实验,我们表明:(i)ACNMP 使系统能够外推至纯 LfD 失效的情形;(ii)通过 SL 与 RL 对系统同时训练,由于两种学习器共用表征,可在适应新情况的同时保持示范轨迹形状;(iii)在抓取任务外推中,与现有方法相比,ACNMP 使 RL 的样本效率提升一个数量级;(iv)ACNMP 可用于实现形态不同的机器人之间的技能迁移,具有有竞争力的学习速度,且相较于最先进方法所需假设更少。最后,我们通过涉及避障、拾取放置和倾倒动作的真实机器人实验,展示了 ACNMP 在真实世界中的适用性。
引用
@article{arxiv.2003.11334,
title = {ACNMP: Skill Transfer and Task Extrapolation through Learning from Demonstration and Reinforcement Learning via Representation Sharing},
author = {M. Tuluhan Akbulut and Erhan Oztop and M. Yunus Seker and Honghu Xue and Ahmet E. Tekden and Emre Ugur},
journal= {arXiv preprint arXiv:2003.11334},
year = {2020}
}
备注
CoRL 2020