中文

ViT-LSLA:具有轻量自限制注意力的视觉Transformer

计算机视觉与模式识别 2022-11-01 v1

摘要

Transformer在广泛的视觉任务中展现出具有竞争力的性能,而计算全局自注意力的代价十分高昂。许多方法将注意力范围限制在局部窗口内以降低计算复杂度。然而,这些方法无法节省参数量;同时,自注意力与内部位置偏置(位于softmax函数内部)导致每个查询聚焦于相似且邻近的图像块。为此,本文提出一种轻量自限制注意力(LSLA),其由轻量自注意力机制(LSA)与自限制注意力机制(SLA)组成,前者用于节省计算成本与参数量,后者用于提升性能。首先,LSA将自注意力的K(键)与V(值)替换为X(原始输入)。将其应用于具有编码器架构与自注意力机制的视觉Transformer中可简化计算。其次,SLA包含位置信息模块与限制注意力模块。前者含动态尺度与内部位置偏置以调整自注意力分数分布并增强位置信息;后者在softmax函数之后使用外部位置偏置来限制部分较大的注意力权重值。最后,提出一种具有轻量自限制注意力的分层视觉Transformer(ViT-LSLA)。实验表明,ViT-LSLA在IP102上达到71.6%的top-1准确率(较Swin-T绝对提升2.4%),在Mini-ImageNet上达到87.2%的top-1准确率(较Swin-T绝对提升3.7%)。此外,其大幅降低了FLOPs(3.5GFLOPs vs. Swin-T的4.5GFLOPs)与参数量(18.9M vs. Swin-T的27.6M)。

关键词

引用

@article{arxiv.2210.17115,
  title  = {ViT-LSLA: Vision Transformer with Light Self-Limited-Attention},
  author = {Zhenzhe Hechen and Wei Huang and Yixin Zhao},
  journal= {arXiv preprint arXiv:2210.17115},
  year   = {2022}
}