中文

利用注意力图中的信息冗余实现视觉Transformer的极端量化

计算机视觉与模式识别 2025-08-25 v1 人工智能 信息论 math.IT

摘要

Transformer模型依赖多头自注意力(MHSA)机制,其中每个注意力头对最终表示有贡献。然而,由于MHSA带来的计算复杂度和高内存需求阻碍了其在边缘端的部署。在本工作中,我们分析并利用注意力图中的信息冗余以加速模型推理。通过使用Shannon熵量化每个注意力头所捕获的信息,我们的分析揭示低熵注意力头,即表现出更确定性行为的注意力头,倾向于贡献更少的信息,从而激励有针对性的压缩策略。基于这些见解,我们提出熵注意力图(EAM),一种冻结低熵注意力图的权重并将这些值量化为低精度以避免冗余重计算的模型。在ImageNet-1k上的经验验证表明,EAM在注意力图稀疏度20%\leq 20\%时达到相似或更高的准确度,并且在DeiT和Swin Transformer模型上在此稀疏度水平之外具有竞争力。

关键词

引用

@article{arxiv.2508.16311,
  title  = {Exploiting Information Redundancy in Attention Maps for Extreme Quantization of Vision Transformers},
  author = {Lucas Maisonnave and Karim Haroun and Tom Pegeot},
  journal= {arXiv preprint arXiv:2508.16311},
  year   = {2025}
}