中文

CLAP:通过语言-动作对齐实现从VLM到VLA的直接适配

机器人学 2026-07-09 v1 人工智能

摘要

视觉-语言-动作模型(VLA)继承了预训练VLM的语义能力,然而,在机器人数据上进行的大规模后训练和架构修改可能会极大地重塑骨干网络,以至于难以区分VLM对控制的贡献。以最小的架构改动直接将预训练的VLM转换为VLA,为理解VLM能力如何跨模型规模迁移提供了一条更透明的途径。核心障碍是输出分布不匹配:将动作预测为裸数值标记序列会使生成偏离VLM预训练的语言分布,从而削弱我们试图保留的能力。为了解决这个问题,我们提出了CLAP(因果语言-动作预测),它在每个数值动作序列前添加一个自然语言动作描述,在不修改骨干架构的情况下,将精确的动作标记预测因果地条件于语言-动作计划。仅通过单轮微调,2B的CLAP在LIBERO上达到了90.8%的准确率(比VLA-0高出14.9个百分点),并在语言、物体和空间扰动下提高了LIBERO-PRO上的鲁棒性。我们将发布0.8B、2B和4B版本的CLAP,作为一个源自单一VLM谱系的开源、多尺度紧凑型VLA系列,从而能够对VLM到VLA的能力迁移进行受控分析。

关键词

引用

@article{arxiv.2607.08974,
  title  = {CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding},
  author = {Yuri Ishitoya and Jeremy Siburian and Masashi Hamaya and Kuniaki Saito and Cristian C. Beltran-Hernandez and Mai Nishimura},
  journal= {arXiv preprint arXiv:2607.08974},
  year   = {2026}
}

备注

Project website: https://omron-sinicx.github.io/clap/