中文

ETA-VLA:基于时间融合和 LLM 内部稀疏化的视觉语言动作模型高效 Token 适配

机器人学 2026-03-30 v1 人工智能

摘要

将视觉语言动作(VLA)模型集成到自动驾驶系统中提供了一种统一框架,用于解释复杂场景并执行控制命令。然而,为准确的时序推理必须包含历史多视角帧,这主要由大语言模型(LLM)自注意力机制的二次复杂度所导致严重的计算负担。为缓解这一瓶颈,我们提出了 ETA-VLA,一种针对 VLA 模型的高效 Token 适配框架。ETA-VLA 处理过去 nn 帧的多视角图像,并引入一种新颖的 LLM 内部稀疏聚合器(ILSA)。我们借鉴人类司机注意力分配的方式,ILSA 利用文本查询和时序一致性动态识别并剪枝冗余的视觉 token。具体而言,我们利用文本引导的评分机制以及保持多样性的稀疏化策略,以选择稀疏的关键 token 子集,确保对驾驶场景的全面了解。在 NAVSIM v2 上进行的大规模实验表明,ETA-VLA 在保持与领先方法相当的驾驶性能的同时,将计算 FLOPs 降低约 32\%。值得注意的是,我们的方法剪枝 85\% 的视觉 token 并降低推理 FLOPs 61\%,但仍保留 NAVSIM v2 数据集基准的 94\% 原始准确率。

关键词

引用

@article{arxiv.2603.25766,
  title  = {ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models},
  author = {Yiru Wang and Anqing Jiang and Shuo Wang and Yuwen Heng and Zichong Gu and Hao Sun},
  journal= {arXiv preprint arXiv:2603.25766},
  year   = {2026}
}