离散时间高斯过程混合模型在机器人策略学习中的不合理有效性
机器人学
2025-05-07 v1 人工智能
机器学习
摘要
我们提出了离散时间高斯过程混合模型(MiDiGap),这是一种用于机器人操作中灵活策略表示和模仿学习的新方法。MiDiGap仅使用相机观测,就能从少至五次演示中学习,并泛化到各种具有挑战性的任务中。它擅长长时间范围的行为(如煮咖啡)、高度约束的运动(如开门)、动态动作(如用铲子舀取)以及多模态任务(如挂杯子)。MiDiGap在CPU上不到一分钟就能学习这些任务,并且能线性扩展到大型数据集。我们还开发了一套丰富的工具,用于利用碰撞信号和机器人运动学约束等证据进行推理时的策略引导。这种引导实现了新颖的泛化能力,包括避障和跨具身策略迁移。MiDiGap在多样化的少样本操作基准测试上达到了领域最佳性能。在受约束的RLBench任务上,它将策略成功率提高了76个百分点,并将轨迹成本降低了67%。在多模态任务上,它将策略成功率提高了48个百分点,并将样本效率提高了20倍。在跨具身迁移中,它将策略成功率提高了一倍以上。我们在https://midigap.cs.uni-freiburg.de上公开了代码。
引用
@article{arxiv.2505.03296,
title = {The Unreasonable Effectiveness of Discrete-Time Gaussian Process Mixtures for Robot Policy Learning},
author = {Jan Ole von Hartz and Adrian Röfer and Joschka Boedecker and Abhinav Valada},
journal= {arXiv preprint arXiv:2505.03296},
year = {2025}
}
备注
Submitted for publication to IEEE Transaction on Robotics