中文

VAT:基于解锁 ViT 完全表征的视觉动作变换器

计算机视觉与模式识别 2026-02-02 v2 机器人学

摘要

在机器人学习中,视觉变换器(ViT)是视觉感知的标准方法,但大多数方法仅使用最后一层的特征,舍弃了宝贵信息。我们认为这提供的表征不足,提出了一种新型架构——视觉动作变换器(Vision Action Transformer,VAT),其基于 ViT 扩展而成,解锁了 ViT 的完整特征层级。VAT 处理具有针对性的动作标记,跨越所有变换器层的视觉特征,实现了感知与动作生成的深入和逐层融合。在一套模拟操作任务上,VAT 在四个 LIBERO 基准测试中实现了 98.15% 的平均成功率,凭借超越 OpenVLA-OFT 等先前方法,建立了新的学习态势。我们的工作不仅为仿照学习提供了强大的模型,还证明了充分利用视觉模型完整“表征轨迹”对推进机器人策略至关重要。项目代码的 GitHub URL 为 https://github.com/sellerbubble/VAT。

关键词

引用

@article{arxiv.2512.06013,
  title  = {VAT: Vision Action Transformer by Unlocking Full Representation of ViT},
  author = {Wenhao Li and Chengwei Ma and Weixin Mao},
  journal= {arXiv preprint arXiv:2512.06013},
  year   = {2026}
}