VSA:在视觉 Transformer 中学习变尺寸窗口注意力
计算机视觉与模式识别
2023-07-04 v2
摘要
窗口内的注意力已在视觉 Transformer 中被广泛探索,以平衡性能、计算复杂度和内存占用。然而,当前模型采用手工设计的固定尺寸窗口,这限制了它们建模长程依赖和适应不同尺寸物体的能力。为解决这一缺陷,我们提出变尺寸窗口注意力(Varied-Size Window Attention, VSA),从数据中学习自适应窗口配置。具体而言,基于每个默认窗口内的 token,VSA 采用窗口回归模块预测目标窗口(即采样键和值 token 的注意力区域)的大小和位置。通过对每个注意力头独立采用 VSA,它可以建模长程依赖,从多样化窗口中捕获丰富上下文,并促进重叠窗口间的信息交换。VSA 是一个易于实现的模块,只需微小修改即可替换最先进代表性模型中的窗口注意力,且额外计算成本可忽略,同时大幅提升性能,例如在 ImageNet 分类上 Swin-T 提升 1.1%。此外,当使用更大图像进行训练和测试时,性能增益增大。在更多下游任务(包括目标检测、实例分割和语义分割)上的实验结果进一步证明了 VSA 相对于原始窗口注意力在处理不同尺寸物体上的优越性。代码将发布于 https://github.com/ViTAE-Transformer/ViTAE-VSA。
引用
@article{arxiv.2204.08446,
title = {VSA: Learning Varied-Size Window Attention in Vision Transformers},
author = {Qiming Zhang and Yufei Xu and Jing Zhang and Dacheng Tao},
journal= {arXiv preprint arXiv:2204.08446},
year = {2023}
}
备注
23 pages, 13 tables, and 5 figures; ECCV 2022 version