带在线规划的离策略学习
机器学习
2021-10-07 v5 人工智能
机器人学
摘要
在低数据量和风险敏感领域的强化学习(RL)需要高性能且灵活的部署策略,能够 readily 在部署时纳入约束。半参数 H 步前瞻策略就是这样一类策略,它们通过在固定视界上使用动力学模型并结合终端值函数进行轨迹优化来选择动作。在这项工作中,我们研究了一种新颖的 H 步前瞻实例化,其使用学习到的模型以及由无模型离策略算法学习的终端值函数,命名为带在线规划的离策略学习(LOOP)。我们提供了该方法的理论分析,表明模型误差与值函数误差之间存在权衡,并通过经验证明这种权衡在深度强化学习中是 beneficial 的。此外,我们指出了该框架中的“Actor 散度”问题,并提出了 Actor 正则化控制(ARC),一种改进的轨迹优化过程。我们在离线和在线 RL 的一组机器人任务上评估了我们的方法,并展示了性能的提升。我们还展示了 LOOP 在部署时通过一组导航环境纳入安全约束的灵活性。我们基于其在各种重要 RL 设定中的强劲表现,证明 LOOP 是机器人应用的一个理想框架。项目视频和细节可在 https://hari-sikchi.github.io/loop 找到。
引用
@article{arxiv.2008.10066,
title = {Learning Off-Policy with Online Planning},
author = {Harshit Sikchi and Wenxuan Zhou and David Held},
journal= {arXiv preprint arXiv:2008.10066},
year = {2021}
}
备注
30 pages, Conference of Robot Learning (CoRL) 2021