中文

面向 Vision Transformer 的分组广义均值池化

计算机视觉与模式识别 2022-12-09 v1

摘要

Vision Transformer (ViT) 遵循自然语言处理 (NLP) 中 Transformer 或计算机视觉中卷积神经网络 (CNNs) 的架构,从类令牌或所有图像块令牌的平均值中提取最终表示。然而,关于聚合图像块令牌最佳方式的研究仍局限于平均池化,而广泛使用的池化策略(如最大池化与 GeM 池化)亦可考虑。尽管有效,现有池化策略未考虑 ViT 的架构及激活图中通道间的差异,以相同重要性聚合关键与琐碎通道。本文提出分组广义均值 (GGeM) 池化,作为一种简单而强大的 ViT 池化策略。GGeM 将通道分为若干组,并以每组共享的池化参数计算 GeM 池化。由于 ViT 通过多头注意力机制对通道分组,GGeM 的通道分组降低了头间依赖性,同时放大了激活图上的重要通道。采用 GGeM 相较基线取得 0.1%p 至 0.7%p 的性能提升,并在 ImageNet-1K 分类任务中对 ViT-Base 与 ViT-Large 模型取得最优性能。此外,GGeM 在图像检索与多模态表示学习任务上优于现有池化策略,证明了其对多种任务的优越性。GGeM 为简单算法,仅需数行代码即可实现。

关键词

引用

@article{arxiv.2212.04114,
  title  = {Group Generalized Mean Pooling for Vision Transformer},
  author = {Byungsoo Ko and Han-Gyu Kim and Byeongho Heo and Sangdoo Yun and Sanghyuk Chun and Geonmo Gu and Wonjae Kim},
  journal= {arXiv preprint arXiv:2212.04114},
  year   = {2022}
}