中文

一种面向 VLA 策略的单 token/frame 视觉带宽重构方案

计算机视觉与模式识别 2026-05-15 v3 人工智能

摘要

视觉语言动作 (VLA) 模型越来越依赖辅助世界模块来规划长期规划,但如何在预训练 VLA 模块之上对其进行参数化仍是一个开放的设计问题。现有的基于世界模型的 VLA 模型通常以高视觉带宽将每个 frame 的视觉流输入到世界模块中,并将其 rollout 视为动作预测的副产品;在冻结 backbone 的受限适应预算下,这会使 per-frame 表示和隐含动作耦合方式得到 insufficient 考察。我们引入 OneWM-VLA,通过自适应注意力池化将每个视角压缩为每个 frame 的单个语义 token,并在单一 flow-matching 目标下产生 resulting latent stream 和动作轨迹,而不是通过单独的 decoder 将其连接。实验上,我们发现,在我们的设置下,per-frame 视觉带宽可以降至单个 token 而不影响长期规划性能。在使用 14.71M LoRA 参数训练的 π0\pi_0 (2B) backbone 上,OneWM-VLA 将在 MetaWorld~MT50 上的平均成功率从 47.9% 提升至 61.3%,在 LIBERO-Long 上达到 95.6%(相较于 π0\pi_0 的 85.2%),并在真实 Piper 机械臂上的长期可塑性任务 Fold Cloth 上达到 60.0%(相较于 π0\pi_0 的 20.0%)。

关键词

引用

@article{arxiv.2605.07931,
  title  = {One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy},
  author = {Zuojin Tang and Shengchao Yuan and Xiaoxin Bai and Zhiyuan Jing and De Ma and Gang Pan and Bin Liu},
  journal= {arXiv preprint arXiv:2605.07931},
  year   = {2026}
}