中文

通过降低核复杂度的紧凑视觉 Transformer

计算机视觉与模式识别 2025-07-18 v1 机器学习

摘要

自注意力和 Transformer 架构已成为现代深度学习中的基础组件。最近的努力将 Transformer 块集成到紧凑神经网络架构中用于计算机视觉,催生了各种高效视觉 Transformer。本文引入了具有 Kernel Complexity Reduction(KCR)的 Transformer,即通过可微信道选择实现紧凑 Transformer 块,这由一种新颖且尖锐的理论泛化界限指导。KCR-Transformer 在 Transformer 块的 MLP 层中执行输入/输出信道选择,以降低计算成本。此外,我们提供了严格的理论分析,为配备 KCR-Transformer 块的网络建立紧密的泛化界限。凭借这种强大的理论结果,KCR-Transformer 通过泛化感知的方式进行信道修剪,确保所得网络保留可证明的小泛化误差。我们的 KCR-Transformer 与许多流行且紧凑的 Transformer 网络兼容,如 ViT 和 Swin,并在保持或甚至提高预测准确性的同时降低视觉 Transformer 的 FLOPs。在实验中,我们将视觉 Transformer 中的所有 Transformer 块替换为 KCR-Transformer 块,导致具有不同主干网络的 TCR-Transformer 实现了各种计算机视觉任务上的优异性能,甚至在更少的 FLOPs 和参数的情况下获得更好的性能。

关键词

引用

@article{arxiv.2507.12780,
  title  = {Compact Vision Transformer by Reduction of Kernel Complexity},
  author = {Yancheng Wang and Yingzhen Yang},
  journal= {arXiv preprint arXiv:2507.12780},
  year   = {2025}
}