中文

仿真训练策略在真实机器人上的零样本不确定性感知部署

机器人学 2021-12-13 v1 人工智能

摘要

尽管深度强化学习(RL)智能体在获取机器人灵巧行为方面展现出惊人潜力,但由于训练与执行环境之间的不匹配,其在真实世界部署时往往会出现错误。相比之下,经典机器人学领域开发了一系列控制器,凭借其显式推导可安全地在真实世界大多数状态下运行。然而,由于解析建模与近似的局限,这些控制器缺乏复杂任务所需的灵巧性。本文中,我们提出贝叶斯控制器融合(BCF),一种新颖的不确定性感知部署策略,结合了深度 RL 策略与传统手工控制器的优势。在该框架中,我们可以进行零样本仿真到真实(sim-to-real)的迁移,其中基于不确定性的表述使机器人能够借助手工控制器在分布外状态下可靠行动,同时在其他情况下获得学习系统的灵巧性。我们在两个真实世界连续控制任务上展示了有前景的结果,BCF 优于独立的策略与控制器,超越了二者各自独立所能达到的水平。展示我们系统的补充视频见 https://bit.ly/bcf_deploy。

关键词

引用

@article{arxiv.2112.05299,
  title  = {Zero-Shot Uncertainty-Aware Deployment of Simulation Trained Policies on Real-World Robots},
  author = {Krishan Rana and Vibhavari Dasagi and Jesse Haviland and Ben Talbot and MIchael Milford and Niko Sünderhauf},
  journal= {arXiv preprint arXiv:2112.05299},
  year   = {2021}
}

备注

Accepted for a poster and spotlight presentation at Neurips 2021 Workshop on Deployable Decision Making in Embodied Systems (DDM). arXiv admin note: substantial text overlap with arXiv:2107.09822