中文

VITA:面向视觉到动作的流匹配策略

计算机视觉与模式识别 2026-03-05 v4 人工智能 机器人学

摘要

传统的流匹配和扩散策略通过迭代从标准噪声分布(如高斯分布)采样,并需要条件模块在生成过程中反复融合视觉信息,导致显著的时间和内存开销。为降低复杂度,我们发展了 VITA(VIsion-To-Action policy),一种无噪声、无条件的流匹配策略学习框架,直接从视觉表征流向潜在动作。由于流的来源是视觉 grounding 的,VITA 在生成过程中无需视觉条件。众所周知,由于动作维度较低、结构更少且更稀疏于视觉表征,桥接视觉与动作具有挑战性;此外,流匹配要求源和目标具有相同的维度。为克服此问题,我们引入了动作自编码器,将原始动作映射到与视觉潜表示对齐的结构化潜空间,并与流匹配联合训练。为进一步防止潜在动作空间在端到端训练中坍缩,我们提出了流潜解码,通过反向传播动作重建损失穿过流匹配 ODE(常微分方程)求解步骤,以锚定潜在生成过程。我们在 ALOHA 和 Robomimic 的 9 个仿真和 5 个真实世界任务上评估了 VITA。VITA 在有条件模块的常规方法推理时快 1.5 倍至 2 倍,同时优于或匹配最先进的策略。项目页面: https://ucd-dare.github.io/VITA/.

关键词

引用

@article{arxiv.2507.13231,
  title  = {VITA: Vision-to-Action Flow Matching Policy},
  author = {Dechen Gao and Boqi Zhao and Andrew Lee and Ian Chuang and Hanchu Zhou and Hang Wang and Zhe Zhao and Junshan Zhang and Iman Soltani},
  journal= {arXiv preprint arXiv:2507.13231},
  year   = {2026}
}

备注

Project page: https://ucd-dare.github.io/VITA/ Code: https://github.com/ucd-dare/VITA