中文

超越注意力幅度:基于跨层秩一致性的高效视觉-语言-动作模型

计算机视觉与模式识别 2026-03-27 v1 计算与语言

摘要

视觉-语言-动作(VLA)模型在机器人操控中表现突出,但因处理稠密视觉 token 而存在显著的推理延迟。现有 token 降采样方法主要依赖注意力幅度作为静态选择标准。本工作挑战这一假设,揭示高注意力 token 是任务依赖性的,且甚至可能损害策略性能。为此,我们引入 TIES(\textbf{T}au-guided \textbf{I}nter-layer \textbf{E}fficient \textbf{S}election),一种由跨层 token 排序一致性驱动的动态框架。通过在注意力幅度与排序一致性之间进行自适应平衡,TIES 实现稳健的 token 选择,而无需额外训练。在 CogACT + SIMPLER 数据集上,TIES 将平均成功率提高6%,同时将 token 使用量降低78%,并在 diverse decoders和基准测试之间展示出强大的泛化能力。

关键词

引用

@article{arxiv.2603.24941,
  title  = {Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models},
  author = {Peiju Liu and Jinming Liu and Xipeng Qiu and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2603.24941},
  year   = {2026}
}

备注

10 pages, 7 figures, preprint