中文

SeTformer:视觉与语言任务所需即所得

计算机视觉与模式识别 2024-01-09 v1

摘要

点积自注意力(DPSA)是 Transformer 的基本组成部分。然而,将其扩展到长序列(如文档或高分辨率图像)时,由于 softmax 操作带来的二次时间与内存复杂度,计算代价变得极其高昂。核方法通过近似 softmax 来简化计算,但与 softmax 注意力相比,常导致性能下降。我们提出 SeTformer,一种新型 Transformer,其中 DPSA 被纯粹替换为自最优传输(SeT),以实现更优的性能和计算效率。SeT 基于 softmax 的两个基本性质:保持非负注意力矩阵,以及使用非线性重加权机制来强调输入序列中的重要 token。通过引入用于最优传输的核代价函数,SeTformer 有效满足了这些性质。特别地,在小模型和基础规模模型上,SeTformer 在 ImageNet-1K 上分别取得了令人瞩目的 84.7% 和 86.2% 的 top-1 准确率。在目标检测中,SeTformer-base 以少 38% 的参数量和少 29% 的 FLOPs,比 FocalNet 对应模型高出 +2.2 mAP。在语义分割中,我们的基础规模模型以少 33% 的参数量,超出 NAT +3.5 mIoU。SeTformer 在 GLUE 基准的语言建模任务中也取得了最先进的结果。这些发现凸显了 SeTformer 在视觉和语言任务中的广泛适用性。

关键词

引用

@article{arxiv.2401.03540,
  title  = {SeTformer is What You Need for Vision and Language},
  author = {Pourya Shamsolmoali and Masoumeh Zareapoor and Eric Granger and Michael Felsberg},
  journal= {arXiv preprint arXiv:2401.03540},
  year   = {2024}
}