中文

大型视觉Transformer的自适应MLP剪枝

计算机视觉与模式识别 2026-03-10 v1

摘要

大型视觉Transformer展现出惊人的可扩展性,其性能可通过增加模型容量获得显著提升。然而,庞大的参数数量导致计算和内存需求居高不下。通过分析常见的Transformer结构,我们发现多层感知器(MLP)模块构成模型参数的主要部分。本文提出一种自适应MLP剪枝(Adaptive MLP Pruning, AMP)方法,在几乎不损失性能的情况下大幅减少大型视觉Transformer的参数。首先,我们采用Taylor方法评估MLP中神经元的重要性。然而,仅使用单热编码交叉熵损失进行重要性计算会忽略其他类别的潜在预测,从而降低评估重要性得分的质量。为此,我们引入基于标签无关信息熵准则的评估方法,以充分建模原始模型的预测,从而实现更精确的重要性评估。随后,我们依据上述重要性得分对MLP的隐藏神经元进行排序,并应用二分查找算法根据不同MLP模块的冗余度自适应剪枝,从而避免预定义的压缩比例。在包括CLIP和DINOv2等多个前沿大型视觉Transformer上进行实验,表明该方法在近乎无损的情况下实现约40%的参数和FLOPs削减。此外,在剪枝后不进行微调时,我们的方法在其他剪枝技术中显著优于。源代码和训练好的模型权重已公开于 https://github.com/visresearch/AMP。

关键词

引用

@article{arxiv.2603.08100,
  title  = {Adaptive MLP Pruning for Large Vision Transformers},
  author = {Chengchao Shen},
  journal= {arXiv preprint arXiv:2603.08100},
  year   = {2026}
}