中文

VLA-4D:将4D意识嵌入视觉-语言-动作模型以实现时空一致的机器人操作

计算机视觉与模式识别 2025-11-24 v1

摘要

视觉-语言-动作(VLA)模型在通用机器人任务中显示出潜力,但在时空一致的操控方面仍具挑战性,这需要细粒度的表征。通常,现有方法将3D位置嵌入视觉表征以增强动作的空间精度。然而,这些方法在实现动作执行的时序一致性控制方面存在困难。本文提出了 VLA-4D,一种具备4D意识的通用 VLA 模型,以实现时空一致的机器人操控。我们的模型受两个关键设计驱动:1)4D感知的视觉表征。我们提取视觉特征,将1维时间嵌入3维位置以实现4维嵌入,并通过跨注意力机制将其融合为统一的视觉表征。2)时空动作表征。我们将常规的空间动作表征扩展包含时间信息,以实现时空规划,并将多模态表征对齐至大语言模型以进行时空动作预测。在该统一框架内,设计的视觉和动作表征共同实现了机器人操控的空间平滑性和时序一致性。此外,我们扩展了 VLA 数据集,加入时间动作标注以进行模型微调。广泛的实验表明,我们的方法在各种机器人操控任务中均显示出优越性。

关键词

引用

@article{arxiv.2511.17199,
  title  = {VLA-4D: Embedding 4D Awareness into Vision-Language-Action Models for SpatioTemporally Coherent Robotic Manipulation},
  author = {Hanyu Zhou and Chuanhao Ma and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2511.17199},
  year   = {2025}
}