中文

4D-VLA:基于跨场景校准的时空视觉-语言-动作预训练

计算机视觉与模式识别 2025-11-19 v2

摘要

利用多样化机器人数据进行预训练仍是关键挑战。现有方法通常仅使用简单观察作为输入来建模数据集的动作分布。然而,这些输入常不完整,导致动作分布分散——我们称之为坐标系统混乱和状态混乱。这种不一致性显著阻碍了预训练效率。为此,我们提出 4D-VLA,一种有效将 4D 信息整合至输入中以缓解这些混乱来源的新方法。我们的模型在视觉特征中引入深度和时间信息,利用顺序 RGB-D 输入对齐机器人与场景的坐标系。这种对齐赋予模型强大的时空推理能力,同时最小化训练开销。此外,我们引入记忆库抽样策略,以从历史图像中提取信息丰富的帧,进一步提高效果和效率。实验结果表明,我们的预训练方法和架构组件显著提升了模型性能。在模拟和真实世界实验中,我们的模型相较 OpenVLA 取得显著的成功率提升。为进一步评估空间感知和对新视角的泛化能力,我们引入 MV-Bench,一个多视角仿真基准。我们的模型在所有现有方法中均表现出更强的空间理解和适应性。

关键词

引用

@article{arxiv.2506.22242,
  title  = {4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration},
  author = {Jiahui Zhang and Yurui Chen and Yueming Xu and Ze Huang and Yanpeng Zhou and Yu-Jie Yuan and Xinyue Cai and Guowei Huang and Xingyue Quan and Hang Xu and Li Zhang},
  journal= {arXiv preprint arXiv:2506.22242},
  year   = {2025}
}