中文

基于演示的安全增强价值估计 (SAVED):面向稀疏代价机器人任务的深度基于模型安全强化学习

机器学习 2020-05-19 v8 人工智能 机器人学 机器学习

摘要

机器人领域的强化学习 (RL) 具有挑战性,原因在于难以手工设计稠密代价函数(可能导致非预期行为),以及动态不确定性使探索和约束满足变得困难。我们通过一种新的基于模型的强化学习算法——基于演示的安全增强价值估计 (SAVED) 来解决这些问题,该算法仅使用标识任务完成的监督信号和少量次优演示来约束探索并高效学习,同时处理复杂约束。随后,我们在涉及导航与操作的 6 个标准仿真基准以及 da Vinci 手术机器人上的物理打结任务上,将 SAVED 与 3 种最先进的基于模型和免模型 RL 算法进行比较。结果表明,SAVED 在成功率、约束满足和样本效率方面优于先前方法,使得在一小时内于真实机器人上直接安全学习控制策略成为可能。对于机器人上的任务,基线方法的成功率低于 5%,而 SAVED 在前 50 次训练迭代中的成功率超过 75%。代码与补充材料见 https://tinyurl.com/saved-rl。

关键词

引用

@article{arxiv.1905.13402,
  title  = {Safety Augmented Value Estimation from Demonstrations (SAVED): Safe Deep Model-Based RL for Sparse Cost Robotic Tasks},
  author = {Brijen Thananjeyan and Ashwin Balakrishna and Ugo Rosolia and Felix Li and Rowan McAllister and Joseph E. Gonzalez and Sergey Levine and Francesco Borrelli and Ken Goldberg},
  journal= {arXiv preprint arXiv:1905.13402},
  year   = {2020}
}

备注

Robotics and Automation Letters and International Conference on Robotics and Automation 2020. First two authors contributed equally