中文

膨胀邻域注意力Transformer

计算机视觉与模式识别 2023-01-18 v3 人工智能 机器学习

摘要

Transformer正迅速成为跨模态、跨领域和跨任务中应用最广泛的深度学习架构之一。在视觉领域,除了持续推进的普通Transformer研究外,分层Transformer也获得了显著关注,这归功于其性能及与现有框架的易集成性。这些模型通常采用局部注意力机制,如滑动窗口邻域注意力(NA)或Swin Transformer的移位窗口自注意力。虽然在降低自注意力的二次复杂度方面有效,局部注意力削弱了自注意力两个最理想的特性:长程相互依赖建模和全局感受野。本文中,我们引入膨胀邻域注意力(DiNA),作为NA的一种自然、灵活且高效的扩展,能以零额外代价捕获更多全局上下文并指数级扩展感受野。NA的局部注意力与DiNA的稀疏全局注意力互为补充,因此我们提出膨胀邻域注意力Transformer(DiNAT),一种基于两者的新型分层视觉Transformer。DiNAT变体相较NAT、Swin和ConvNeXt等强基线获得显著改进。我们的大模型在COCO目标检测中比其Swin对应模型快且领先1.6% box AP,在COCO实例分割中领先1.4% mask AP,在ADE20K语义分割中领先1.4% mIoU。结合新框架,我们的大变体成为COCO(58.5 PQ)和ADE20K(49.4 PQ)上新的最先进全景分割模型,以及Cityscapes(45.1 AP)和ADE20K(35.4 AP)上的实例分割模型(无额外数据)。它还在ADE20K(58.1 mIoU)上与最先进的专用语义分割模型持平,并在Cityscapes(84.5 mIoU)上排名第二(无额外数据)。

关键词

引用

@article{arxiv.2209.15001,
  title  = {Dilated Neighborhood Attention Transformer},
  author = {Ali Hassani and Humphrey Shi},
  journal= {arXiv preprint arXiv:2209.15001},
  year   = {2023}
}

备注

Large results were updated according to the new checkpoint. We open-source our project at https://github.com/SHI-Labs/Neighborhood-Attention-Transformer