中文

增强基于 Transformer 的视觉模型:通过新颖优化策略解决特征图异常

计算机视觉与模式识别 2025-09-25 v1

摘要

视觉 Transformer (ViTs) 在广泛的计算机视觉任务中展示了卓越的性能。然而,其特征图中的结构化噪声伪影阻碍了下游应用,如分割和深度估计。我们提出了两种新颖且轻量级的优化技术——结构化 Token 增强 (STA) 和自适应噪声过滤 (ANF)——以提高可解释性并减轻这些伪影。STA 通过在 Token 化过程中进行空间扰动来增强 Token 多样性,而 ANF 在 Transformer 层之间应用可学习的在线去噪。这些方法与架构无关,并在包括 ImageNet、Ade20k 和 NYUv2 在内的标准基准上进行了评估。实验结果表明,视觉质量和任务性能均得到持续改进,突出了我们方法的实际有效性。

关键词

引用

@article{arxiv.2509.19687,
  title  = {Enhancing Transformer-Based Vision Models: Addressing Feature Map Anomalies Through Novel Optimization Strategies},
  author = {Sumit Mamtani},
  journal= {arXiv preprint arXiv:2509.19687},
  year   = {2025}
}

备注

8 pages, 8 figures, accepted and presented at IEEE BDAI 2025. The final published version will be available on IEEE Xplore