视觉大鸟:面向全注意力的随机稀疏化
计算机视觉与模式识别
2023-11-13 v1
摘要
近来,Transformer在各种视觉任务中展现出良好性能。然而,全局自注意力的高计算成本对Transformer仍是挑战,尤其对高分辨率视觉任务。受最成功的基于Transformer的NLP模型之一Big Bird启发,我们提出一种用于视觉Transformer(ViT)的新型稀疏注意力机制。具体而言,我们将头分为三组:第一组使用卷积神经网络(CNN)提取局部特征并为模型提供位置信息;第二组使用随机采样窗口(RS-Win)进行稀疏自注意力计算;第三组通过平均池化降低键与值的分辨率以实现全局注意力。基于这些组件,ViT在保持自注意力稀疏性的同时保留了Big Bird的优点(即模型是序列函数的通用逼近器且是图灵完备的)。此外,我们的结果表明,作为ViT关键组件的位置编码在本模型中可被安全移除。实验表明Vision Big Bird在常见视觉任务上展现出有竞争力的性能。
引用
@article{arxiv.2311.05988,
title = {Vision Big Bird: Random Sparsification for Full Attention},
author = {Zhemin Zhang and Xun Gong},
journal= {arXiv preprint arXiv:2311.05988},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2304.06250