面向机器人操作中样本高效策略改进的贝叶斯优化
机器人学
2024-10-08 v2
摘要
操作技能的样本高效学习是机器人学面临的一项重大挑战。尽管近期方法在可处理的任务类型和可融合的感知模态方面取得了令人瞩目的进展,但它们仍需要大量的训练数据。特别是对于在真实世界中学习机器人动作而言,由于演示和真实世界机器人交互的高昂成本,这构成了一个主要问题。为应对这一挑战,我们引入了BOpt-GMM,这是一种将模仿学习与自身经验收集相结合的混合方法。我们首先从少量演示中学习一个技能模型,该模型表示为编码在高斯混合模型中的动力学系统。然后,我们在稀疏奖励设置下,基于少量自主技能执行,利用贝叶斯优化来改进此模型。我们在仿真和真实世界实验中,在多个复杂操作技能上展示了我们方法的样本效率。此外,我们在http://bopt-gmm.cs.uni-freiburg.de上公开提供了代码和预训练模型。
引用
@article{arxiv.2403.14305,
title = {Bayesian Optimization for Sample-Efficient Policy Improvement in Robotic Manipulation},
author = {Adrian Röfer and Iman Nematollahi and Tim Welschehold and Wolfram Burgard and Abhinav Valada},
journal= {arXiv preprint arXiv:2403.14305},
year = {2024}
}
备注
8 pages, 5 figures, 2 tables, Accepted at the 2024 IEEE International Conference on Intelligent Robots and Systems (IROS)