中文

VLA-InfoEntropy: 一种无训练的视觉-注意力信息熵方法用于加速视觉-语言-动作模型推理

计算机视觉与模式识别 2026-04-08 v1 机器人学

摘要

视觉-语言-动作(VLA)模型整合视觉感知、语言理解和动作决策,实现跨模态语义对齐,具有广泛的应用潜力。然而,高维视觉特征、复杂语言输入和连续动作序列的联合处理导致计算开销大、推理效率低,进而阻碍了实时部署和可靠性。为此,我们利用图像熵量化每个视觉 token 的灰度分布特征,引入注意力熵来捕获注意力得分在任务相关文本上的分布。视觉熵识别纹理丰富或结构信息丰富的区域,而注意力熵则定位语义相关的 token。结合时间步信息,这些指标启用了一种动态转换策略,使模型焦点从全局视觉特征转向注意力引导的局部信息区域。因此,VLA-InfoEntropy 方法整合了空间、语义和时间线索,在保留关键内容的同时减少冗余。大量实验表明,我们的方法减少推理参数、加速推理速度,并优于现有方法。

关键词

引用

@article{arxiv.2604.05323,
  title  = {VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success},
  author = {Chuhang Liu and Yayun He and Zuheng Kang and Xiaoyang Qu and Jianzong Wang},
  journal= {arXiv preprint arXiv:2604.05323},
  year   = {2026}
}

备注

Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)