中文

ConLA:基于人类视频的对比式潜在动作学习用于机器人操作

机器人学 2026-02-03 v1

摘要

视觉-语言-动作(VLA)模型通过在大规模机器人遥操作数据集上预训练实现初步的泛化,但获取全面覆盖多样任务和环境的数据集在成本和可扩展性方面极具挑战性。相比之下,人类演示视频提供了丰富且可扩展的多样场景和操作行为来源,但缺乏显式的动作监督,限制了其直接利用。先前的工作利用基于VQ-VAE的框架以无监督方式从人类视频中学习潜在动作。然而,由于训练目标主要关注重建视觉外观而非捕捉帧间动态,所学表示倾向于依赖虚假的视觉线索,导致捷足其道的学习和 entangled 的潜在表示,阻碍了可迁移性。为此,我们提出ConLA,一个用于从人类视频中学习机器人策略的无监督预训练框架。ConLA引入对比性解�合机制,利用动作类别先验和时间线索将运动动态从视觉内容中隔离,有效缓解捷足其道的学习。大量实验表明,ConLA在多样化基准上实现了优异性能。值得注意的是,仅凭人类视频的预训练,我们的方法首次超越了使用真实机器人轨迹预训练获得的性能,凸显了其从可扩展的人类视频中提取纯粹且语义一致潜在动作表示的能力。

关键词

引用

@article{arxiv.2602.00557,
  title  = {ConLA: Contrastive Latent Action Learning from Human Videos for Robotic Manipulation},
  author = {Weisheng Dai and Kai Lan and Jianyi Zhou and Bo Zhao and Xiu Su and Junwen Tong and Weili Guan and Shuo Yang},
  journal= {arXiv preprint arXiv:2602.00557},
  year   = {2026}
}