中文

CLAP:从人类视频中学习视觉-语言-动作模型的对比潜在动作预训练

机器人学 2026-01-08 v1 计算机视觉与模式识别

摘要

通用视觉-语言-动作模型目前受到机器人数据稀缺的阻碍,而人类视频演示则相对丰富。现有的潜在动作模型试图利用视频数据,但常常遭受视觉纠缠,捕获的是噪声而非操作技能。为了解决这个问题,我们提出了对比潜在动作预训练(CLAP),一个将视频的视觉潜在空间与机器人轨迹的本体感受潜在空间对齐的框架。通过采用对比学习,CLAP 将视频转换映射到一个量化的、物理可执行的码本上。基于这种表示,我们引入了一个双公式 VLA 框架,提供 CLAP-NTP(一个在指令遵循和物体泛化方面表现出色的自回归模型)和 CLAP-RF(一个专为高频、精确操作设计的基于整流流的策略)。此外,我们提出了一种知识匹配(KM)正则化策略,以减轻微调过程中的灾难性遗忘。大量实验表明,CLAP 显著优于强基线,实现了从人类视频到机器人执行的有效技能迁移。项目页面:https://lin-shan.com/CLAP/。

关键词

引用

@article{arxiv.2601.04061,
  title  = {CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos},
  author = {Chubin Zhang and Jianan Wang and Zifeng Gao and Yue Su and Tianru Dai and Cai Zhou and Jiwen Lu and Yansong Tang},
  journal= {arXiv preprint arXiv:2601.04061},
  year   = {2026}
}

备注

Project page: https://lin-shan.com/CLAP/