中文

贝叶斯控制器融合:在机器人深度强化学习中利用控制先验

机器人学 2023-04-05 v3 人工智能 系统与控制 系统与控制

摘要

我们提出贝叶斯控制器融合(Bayesian Controller Fusion, BCF):一种将传统手工控制器与无模型深度强化学习(RL)的优势相结合的混合控制策略。BCF 在机器人领域表现出色,该领域中许多任务存在可靠但次优的控制先验,而从零开始的 RL 仍然不安全且数据效率低。通过融合各系统具有不确定性感知的分布输出,BCF 在二者间仲裁控制,发挥各自优势。我们在两个真实机器人任务上研究 BCF:一是广阔长程环境中的导航,二是涉及可操作度最大化的复杂到达任务。对于这两个领域,都存在简单的手工控制器能以风险规避方式解决当前任务,但由于解析建模的局限、控制器误校准和任务变化,未必给出最优解。由于训练早期探索自然由先验引导,BCF 加速了学习,同时随着策略获得更多经验,大幅超越控制先验的性能。更重要的是,鉴于控制先验的风险规避性,BCF 确保了安全的探索与部署,在策略未知的状态中控制先验自然主导动作分布。我们还展示了 BCF 对零样本仿真到实机(sim-to-real)设置的适用性,及其处理真实世界中分布外状态的能力。BCF 是一种有前景的方法,可结合深度 RL 与传统机器人控制的互补优势,超越二者各自独立所能达到的成效。代码与补充视频材料公开于 https://krishanrana.github.io/bcf。

关键词

引用

@article{arxiv.2107.09822,
  title  = {Bayesian Controller Fusion: Leveraging Control Priors in Deep Reinforcement Learning for Robotics},
  author = {Krishan Rana and Vibhavari Dasagi and Jesse Haviland and Ben Talbot and Michael Milford and Niko Sünderhauf},
  journal= {arXiv preprint arXiv:2107.09822},
  year   = {2023}
}

备注

The International Journal of Robotics Research (IJRR), 2023. Project page: https://krishanrana.github.io/bcf