超越注意力幅度:基于跨层秩一致性的高效视觉-语言-动作模型
计算机视觉与模式识别
2026-03-27 v1 计算与语言
摘要
视觉-语言-动作(VLA)模型在机器人操控中表现突出,但因处理稠密视觉 token 而存在显著的推理延迟。现有 token 降采样方法主要依赖注意力幅度作为静态选择标准。本工作挑战这一假设,揭示高注意力 token 是任务依赖性的,且甚至可能损害策略性能。为此,我们引入 TIES(\textbf{T}au-guided \textbf{I}nter-layer \textbf{E}fficient \textbf{S}election),一种由跨层 token 排序一致性驱动的动态框架。通过在注意力幅度与排序一致性之间进行自适应平衡,TIES 实现稳健的 token 选择,而无需额外训练。在 CogACT + SIMPLER 数据集上,TIES 将平均成功率提高6%,同时将 token 使用量降低78%,并在 diverse decoders和基准测试之间展示出强大的泛化能力。
引用
@article{arxiv.2603.24941,
title = {Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models},
author = {Peiju Liu and Jinming Liu and Xipeng Qiu and Xuanjing Huang},
journal= {arXiv preprint arXiv:2603.24941},
year = {2026}
}
备注
10 pages, 7 figures, preprint