中文

洞察空间与运动:为视觉-语言-动作模型增强潜在动作的几何与动态感知

计算机视觉与模式识别 2026-03-12 v2

摘要

潜在动作模型(LAMs)使视觉-语言-动作(VLA)系统能够从大规模未标注数据中学习语义动作表示。然而,我们发现了LAMs的两个瓶颈:1)常用的端到端训练图像编码器空间理解能力较差;2)当输入帧在时间上相距较远时,LAMs可能表现脆弱,导致时间感知能力有限。这些因素不可避免地阻碍了稳定清晰的动作建模。为此,我们提出了Farsighted-LAM,一个具有几何感知空间编码和多尺度时间建模的潜在动作框架,能够从连续帧中捕获结构先验和动态运动模式。我们进一步提出了SSM-VLA,一个基于Farsighted-LAM构建的端到端VLA框架,它将结构化感知与视觉思维链模块相结合,以显式推理环境动态,从而增强决策一致性和可解释性。我们在仿真和真实环境中的多个VLA任务上验证了SSM-VLA,并取得了最先进的性能。结果表明,我们结合几何感知建模、时间连贯性和显式推理的策略,能有效增强具身智能的鲁棒性和泛化能力。

关键词

引用

@article{arxiv.2509.26251,
  title  = {Seeing Space and Motion: Enhancing Latent Actions with Geometric and Dynamic Awareness for Vision-Language-Action Models},
  author = {Zhejia Cai and Yandan Yang and Xinyuan Chang and Shiyi Liang and Ronghan Chen and Feng Xiong and Mu Xu and Ruqi Huang},
  journal= {arXiv preprint arXiv:2509.26251},
  year   = {2026}
}

备注

8 pages, correct errors, clarify details