乘法控制器融合:利用算法先验实现样本高效的强化学习和安全的仿真到现实迁移
机器人学
2020-07-28 v3 人工智能
摘要
基于学习的方法通常在机器人学的许多问题上优于手工编码的算法解决方案。然而,在真实机器人硬件上学习长时域任务可能是棘手的,并且将学习到的策略从仿真迁移到现实仍然极具挑战性。我们提出了一种新颖的无模型强化学习方法,该方法可以在训练和部署期间利用现有的次优解决方案作为算法先验。在训练期间,我们的门控融合方法使先验能够引导初始探索阶段,提高样本效率,并能够从稀疏的长时域奖励信号中学习。重要的是,由于先验的影响逐渐减弱,策略可以学习超越次优先验的性能。在部署期间,策略的不确定性提供了一种可靠的策略,通过在不确定状态下回退到先验控制器,将仿真训练的策略迁移到现实世界。我们在机器人导航任务上展示了乘法控制器融合方法的有效性,并展示了无需任何微调即可从仿真安全迁移到现实世界。该项目的代码已在 https://sites.google.com/view/mcf-nav/home 公开。
引用
@article{arxiv.2003.05117,
title = {Multiplicative Controller Fusion: Leveraging Algorithmic Priors for Sample-efficient Reinforcement Learning and Safe Sim-To-Real Transfer},
author = {Krishan Rana and Vibhavari Dasagi and Ben Talbot and Michael Milford and Niko Sünderhauf},
journal= {arXiv preprint arXiv:2003.05117},
year = {2020}
}
备注
Accepted for presentation at IROS2020. Project site available at https://sites.google.com/view/mcf-nav/home