人类到机器人在视觉语言动作模型中的迁移现象
机器人学
2025-12-30 v1 人工智能
摘要
视觉语言动作 (VLA) 模型可以实现广泛的开放世界泛化,但需要大量且多样化的数据。从人类视频中获取部分数据显然是吸引人的,因为人类视频覆盖了多样化的真实场景且容易获取。然而,仅凭人类视频难以训练 VLAs,建立人类与机器人之间的映射需要人工工程且面临重大研究挑战。drawing inspiration from advances in large language models, where the ability to learn from diverse supervision emerges with scale, 我们询问类似现象是否也适用于包含人类视频数据的 VLAs。我们引入一种简单的 co-training 配方,发现只要 VLA 在足够的场景、任务和 embodiments 上进行预训练,人类到机器人的迁移便会出现。我们的分析表明,这种现象性质的能力源于多样化的预训练产生的对人类和机器人数据都具备 embodiment-agnostic 表示。我们通过一系列探索人类到机器人技能迁移的实验验证了这些发现,发现只要预训练足够多样化,我们的方法可以在仅见于人类数据中的泛化设置下几乎翻倍性能。
引用
@article{arxiv.2512.22414,
title = {Emergence of Human to Robot Transfer in Vision-Language-Action Models},
author = {Simar Kareer and Karl Pertsch and James Darpinian and Judy Hoffman and Danfei Xu and Sergey Levine and Chelsea Finn and Suraj Nair},
journal= {arXiv preprint arXiv:2512.22414},
year = {2025}
}