中文

面向机器人操作的可扩展视觉语言动作模型预训练

机器人学 2025-10-27 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

本文提出了一种新方法,利用大量未经标注的真实生活人类手部活动视频来预训练机器人操作视觉语言动作(VLA)模型。将人类手部视为灵巧机器人末端执行器,我们展示了'在野外'的第三人称视角人类视频可转换为与现有机器人V-L-A训练数据在任务粒度和标签方面完全对齐的数据格式。通过开发一种用于任意人类手部视频的全自动综合人类活动分析方法来实现这一点。该方法可为每个手部活动片段及其语言描述生成帧级3D手部运动和相机运动。我们处理了大量的第三人称视角视频,创建了一个包含100万个 episode 和2600万帧的手部-VLA训练数据集。该训练数据覆盖了广泛的物体和概念、灵巧操作任务以及真实生活中的环境变化,远超现有机器人数据的覆盖范围。我们设计了灵巧手部VLA模型架构,并在该数据集上进行预训练。该模型在完全未见过的真实世界观察上表现出强大的零样性能能。此外,在少量真实机器人动作数据上进行微调可显著提高任务成功率和对新物体的泛化能力。我们还展示了该模型任务性能随预训练数据规模而提升的令人期待的扩展行为。我们认为这项工作为可扩展的VLA预训练奠定了坚实基础,推动机器人向真正通用且具备嵌入式智能的方向发展。

关键词

引用

@article{arxiv.2510.21571,
  title  = {Scalable Vision-Language-Action Model Pretraining for Robotic Manipulation with Real-Life Human Activity Videos},
  author = {Qixiu Li and Yu Deng and Yaobo Liang and Lin Luo and Lei Zhou and Chengtang Yao and Lingqi Zeng and Zhiyuan Feng and Huizhi Liang and Sicheng Xu and Yizhong Zhang and Xi Chen and Hao Chen and Lily Sun and Dong Chen and Jiaolong Yang and Baining Guo},
  journal= {arXiv preprint arXiv:2510.21571},
  year   = {2025}
}

备注

Project page: https://microsoft.github.io/VITRA/