中文

P3-PO:用于机器人策略视觉空间泛化的指示性点先验

机器人学 2024-12-10 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

开发能够鲁棒处理多样化环境条件和物体实例的通用机器人策略仍然是机器人学习中的一个基本挑战。虽然已有大量工作致力于收集大规模机器人数据集并开发策略架构来从中学习,但仅从视觉输入进行朴素学习往往导致脆弱的策略,无法迁移到训练数据之外。本工作提出了策略的指示性点先验(P3-PO),一种利用计算机视觉和机器人学习的最新进展构建环境独特状态表示的框架,以实现改进的分布外机器人操作泛化。该表示通过两个步骤获得。首先,人类标注者在单张示教帧上指定一组语义上有意义的点。然后,这些点通过现成视觉模型在整个数据集中传播。得到的点作为最先进的策略架构的输入用于策略学习。我们在四个真实世界任务上的实验表明,在与训练相同的设置下评估时,总体相对于先前方法实现了 43% 的绝对提升。此外,P3-PO 在新物体实例和更杂乱的环境任务上分别实现了 58% 和 80% 的增益。展示机器人性能的视频可在 point-priors.github.io 上查看。

关键词

引用

@article{arxiv.2412.06784,
  title  = {P3-PO: Prescriptive Point Priors for Visuo-Spatial Generalization of Robot Policies},
  author = {Mara Levy and Siddhant Haldar and Lerrel Pinto and Abhinav Shirivastava},
  journal= {arXiv preprint arXiv:2412.06784},
  year   = {2024}
}