分解视觉Transformer:以局部窗口代价建模长程依赖
计算机视觉与模式识别
2023-12-15 v1
摘要
Transformer 具有惊人的表示能力,但通常消耗大量计算,且与图像分辨率呈二次方关系。主流的 Swin transformer 通过局部窗口策略降低了计算成本。然而,该策略不可避免地导致两个缺陷:(1)基于局部窗口的自注意力阻碍了全局依赖建模能力;(2)最近的研究指出局部窗口削弱了鲁棒性。为了克服这些挑战,我们寻求计算成本与性能之间更佳的权衡。因此,我们提出了一种新颖的分解自注意力机制(FaSA),它兼具局部窗口的计算成本优势和长程依赖建模能力。通过将传统的注意力矩阵分解为稀疏子注意力矩阵,FaSA 在捕获长程依赖的同时聚合混合粒度信息,其计算成本与基于局部窗口的自注意力相当。利用 FaSA,我们提出了具有分层结构的分解视觉Transformer(FaViT)。FaViT 实现了高性能和鲁棒性,且关于输入图像空间分辨率具有线性计算复杂度。大量实验表明 FaViT 在分类和下游任务中表现出色。此外,它对损坏和有偏差的数据也表现出很强的模型鲁棒性,从而展现出有利于实际应用的优势。与基线模型 Swin-T 相比,我们的 FaViT-B2 将分类准确率显著提高了1%,鲁棒性提高了7%,同时模型参数减少了14%。我们的代码即将在 https://github.com/q2479036243/FaViT 公开发布。
引用
@article{arxiv.2312.08614,
title = {Factorization Vision Transformer: Modeling Long Range Dependency with Local Window Cost},
author = {Haolin Qin and Daquan Zhou and Tingfa Xu and Ziyang Bian and Jianan Li},
journal= {arXiv preprint arXiv:2312.08614},
year = {2023}
}