中文

从像素到词元:视觉-语言-动作模型中潜在动作监督的系统性研究

机器人学 2026-05-07 v1 计算机视觉与模式识别

摘要

潜在动作作为一种中间表示,能够跨异构数据集实现对视觉-语言-动作 (VLA) 模型的一致建模。然而,利用潜在动作监督 VLA 的方法较为分散,且缺乏系统性的比较。本研究从两个视角构建了潜在动作监督的研究框架: 通过基于图像的潜在动作对轨迹进行正则化,以及 通过基于动作的潜在动作统一目标空间。在统一的 VLA 基线下,我们实例化并比较了四种具有代表性的集成策略。我们的结果揭示了公式与任务之间的对应关系:基于图像的潜在动作有利于长程推理和场景级泛化,而基于动作的潜在动作则擅长复杂的运动协调。此外,我们发现直接使用离散潜在动作词元监督 VLM 能产生最有效的性能。最后,我们的实验为混合数据中潜在动作监督的益处提供了初步见解,指明了 VLA 训练的一个有前景的方向。代码可在 https://github.com/RUCKBReasoning/From_Pixels_to_Tokens 获取。

关键词

引用

@article{arxiv.2605.04678,
  title  = {From Pixels to Tokens: A Systematic Study of Latent Action Supervision for Vision-Language-Action Models},
  author = {Yihan Lin and Haoyang Li and Yang Li and Haitao Shen and Yihan Zhao and Chao Shao and Jing Zhang},
  journal= {arXiv preprint arXiv:2605.04678},
  year   = {2026}
}