ScalableViT:重新思考视觉Transformer的面向上下文泛化
计算机视觉与模式识别
2022-07-19 v2 人工智能
摘要
原始的自注意力机制本质上依赖于预定义且固定的计算维度。这种不灵活性限制了其具备面向上下文的泛化能力,而该能力可带来更多上下文线索与全局表征。为缓解此问题,我们提出可扩展自注意力(Scalable Self-Attention, SSA)机制,利用两个缩放因子释放查询、键和值矩阵的维度,同时将其与输入解绑。这种可扩展性获取了面向上下文的泛化并增强了对目标的敏感性,使整个网络在精度与代价之间达到更有效的权衡状态。此外,我们提出基于交互窗口的自注意力(Interactive Window-based Self-Attention, IWSA),通过重新合并独立的值令牌并聚合来自相邻窗口的空间信息,在非重叠区域间建立交互。通过交替堆叠 SSA 与 IWSA,可扩展视觉Transformer(Scalable Vision Transformer, ScalableViT)在通用视觉任务上取得了最先进的性能。例如,ScalableViT-S 在 ImageNet-1K 分类上优于 Twins-SVT-S 1.4%,优于 Swin-T 1.8%。
引用
@article{arxiv.2203.10790,
title = {ScalableViT: Rethinking the Context-oriented Generalization of Vision Transformer},
author = {Rui Yang and Hailong Ma and Jie Wu and Yansong Tang and Xuefeng Xiao and Min Zheng and Xiu Li},
journal= {arXiv preprint arXiv:2203.10790},
year = {2022}
}
备注
This paper appears at ECCV2022