保持 SimPool 的简洁性:谁说有监督 Transformer 存在注意力不足?
计算机视觉与模式识别
2023-09-14 v1 机器学习
摘要
卷积网络与视觉 Transformer 具有不同形式的成对交互、跨层池化以及网络末端池化。后者真的需要有所不同吗?作为池化的副产品,视觉 Transformer 天然提供空间注意力,但这在多数情况下质量较低,除非采用自监督,而这一点尚未被充分研究。监督真的是问题所在吗?在本工作中,我们开发了一个通用池化框架,并将若干现有方法表述为该框架的实例。通过讨论各类方法的特性,我们推导出 SimPool——一种简单的基于注意力的池化机制,用作卷积与 Transformer 编码器的默认池化替代方案。我们发现,无论有监督还是自监督,它都能提升预训练与下游任务性能,并在所有情况下提供勾勒物体边界的注意力图。因此可称 SimPool 为通用的。据我们所知,我们首次在有监督 Transformer 中获得了至少与自监督同等质量的注意力图,且无需显式损失或修改架构。代码见:https://github.com/billpsomas/simpool。
引用
@article{arxiv.2309.06891,
title = {Keep It SimPool: Who Said Supervised Transformers Suffer from Attention Deficit?},
author = {Bill Psomas and Ioannis Kakogeorgiou and Konstantinos Karantzalos and Yannis Avrithis},
journal= {arXiv preprint arXiv:2309.06891},
year = {2023}
}
备注
ICCV 2023. Code and models: https://github.com/billpsomas/simpool