关于关键点模仿学习的泛化能力、设计选择与局限性
机器人学
2026-05-27 v1
摘要
基于 RGB 的模仿学习需要大量演示才能泛化到未见对象或场景,这促使研究人员寻求中间表示以提高机器人操纵的泛化能力。视觉基础模型 enable 一键从未见对象中提取关键点,从而提供此类表示。然而,如何将其集成到模仿学习中以获得最佳整合,以及何时超过替代表示,仍不清楚。我们组合了先前关于关键点模仿学习 (KIL) 的方法,并研究了若干设计选择,以提供实用指南。使用超过 2000 次真实世界 rollout,我们还评估了 KIL 对未见对象和场景变体的泛化能力。KIL 在五个任务中实现了 75\% 的整体成功率,显著优于 RGB 基线 (47\%),并与 S2-diffusion (73\%) 持平。最后,我们探讨了用于关键点提取的基础模型的局限性,并将 KIL 扩展到多个对象实例的任务。我们的结果确认 KIL 作为一种数据高效的机器人学习方法,尽管它不超过替代表示,并继承了用于关键点提取的基础模型的局限性。所有 rollout 视频、演示和结果均可在 https://kil-manipulation.github.io/ 上获取。
引用
@article{arxiv.2605.26649,
title = {On the Generalization Capabilities, Design Choices and Limitations of Keypoint Imitation Learning},
author = {Thomas Lips and Marco Moletta and Michael C. Welle and Danica Kragic and Francis wyffels},
journal= {arXiv preprint arXiv:2605.26649},
year = {2026}
}
备注
This version was submitted to IROS 2026