中文

利用全局平均池化最大化视觉Transformer的位置嵌入效果

计算机视觉与模式识别 2025-02-06 v1 机器学习

摘要

在视觉Transformer中,位置嵌入(Position Embedding, PE)在捕获令牌的顺序方面起着至关重要的作用。然而,在视觉Transformer结构中,由于位置嵌入被简单地加到令牌嵌入上,PE的表达能力存在局限性。为了克服这一限制,一种逐层方法被采用,该方法将PE传递到每一层,并对令牌嵌入和PE应用独立的层归一化。本文中,我们识别出在使用全局平均池化(Global Average Pooling, GAP)方法替代类别令牌时,逐层结构中出现的冲突结果。为解决此问题,我们提出了MPVG,它在使用GAP的逐层结构中最大化PE的有效性。具体而言,我们识别出在逐层结构中,PE在每一层都起到平衡令牌嵌入值的作用。此外,我们认识到PE的这种平衡作用在逐层结构中是不充分的,并通过MPVG最大化PE的有效性来解决这个问题。通过实验,我们证明了PE执行平衡作用,并且保持这种平衡方向性对视觉Transformer有显著影响。实验结果表明,MPVG在各种任务的视觉Transformer上均优于现有方法。

关键词

引用

@article{arxiv.2502.02919,
  title  = {Maximizing the Position Embedding for Vision Transformers with Global Average Pooling},
  author = {Wonjun Lee and Bumsub Ham and Suhyun Kim},
  journal= {arXiv preprint arXiv:2502.02919},
  year   = {2025}
}

备注

Accepted at AAAI 2025