超越动作标签数据的通用机器人操控
机器人学
2025-09-25 v1
摘要
近期通用机器人操控的进展利用预训练的视觉语言模型(VLM)和大规模机器人演示数据,以零样本方式解决多样化任务。一个关键挑战仍是:扩大高质量、带动作标签的机器人演示数据,这些数据是现有方法依赖的以实现鲁棒性和泛化。为此,我们提出一种方法,从无动作标签的视频(包含人类和/或机器人动作)中受益,以提升开放词汇表性能,并实现新任务的数据高效学习。我们的方法从手或抓手位置提取稠密、动态3D点云,并使用提出的3D动力学预测器进行自监督学习。该预测器随后使用较小的标记数据集进行动作对齐调优。我们表明,该方法不仅能从无标签的人类和机器人演示中学习——提升下游通用机器人策略的效果——还能使机器人在无动作标签的情况下学习新任务(即超出动作标签的泛化)在真实环境和模拟环境中均取得成功。
引用
@article{arxiv.2509.19958,
title = {Generalist Robot Manipulation beyond Action Labeled Data},
author = {Alexander Spiridonov and Jan-Nico Zaech and Nikolay Nikolov and Luc Van Gool and Danda Pani Paudel},
journal= {arXiv preprint arXiv:2509.19958},
year = {2025}
}
备注
Accepted at Conference on Robot Learning 2025