中文

SafeAPT:使用仿真中学习的多样性策略实现安全的仿真到真实机器人学习

机器人学 2022-02-01 v1 人工智能 机器学习 神经与进化计算

摘要

仿真到真实(Simulation-to-real)学习框架,即在仿真中学习策略并将这些策略迁移到真实世界,是机器人领域实现数据高效学习最有前景的方法之一。然而,由于仿真与真实世界之间不可避免的现实鸿沟(reality gap),在仿真中学习到的策略并不总是能在真实机器人上产生安全的行为。因此,在真实世界中进行策略适应时,机器人可能会损坏自身或对其周围环境造成伤害。在本研究中,我们引入了一种名为 SafeAPT 的新型学习算法,该算法利用在仿真中演化出的多样化策略库,并通过情景交互将最有前景的安全策略迁移到真实机器人上。为实现这一点,SafeAPT 迭代地学习概率奖励模型以及安全模型,将真实世界观测与作为先验的仿真经验相结合。然后,它利用奖励模型在策略库上执行贝叶斯优化,同时使用安全模型维持指定的安全约束。SafeAPT 允许机器人利用在仿真中演化的同一策略库安全地适应广泛的目标。我们在仿真和真实机器人实验中将 SafeAPT 与多个基线方法进行了比较,结果表明 SafeAPT 能够在真实世界中几分钟内找到高性能策略,同时在交互过程中最小化安全违规。

关键词

引用

@article{arxiv.2201.13248,
  title  = {SafeAPT: Safe Simulation-to-Real Robot Learning using Diverse Policies Learned in Simulation},
  author = {Rituraj Kaushik and Karol Arndt and Ville Kyrki},
  journal= {arXiv preprint arXiv:2201.13248},
  year   = {2022}
}

备注

Under review. For video of the paper http://tiny.cc/safeAPT