RMT:Retentive网络遇见视觉Transformer
计算机视觉与模式识别
2025-02-28 v6
摘要
视觉Transformer(ViT)近年来在计算机视觉界获得了越来越多的关注。然而,ViT的核心组件自注意力缺乏显式空间先验且带有二次计算复杂度,从而限制了ViT的适用性。为缓解这些问题,我们从NLP领域近期的Retentive网络(RetNet)中汲取灵感,提出RMT,一种具有显式空间先验的通用强视觉骨干网络。具体而言,我们将RetNet的时间衰减机制扩展到空间域,并基于曼哈顿距离提出空间衰减矩阵,以将显式空间先验引入自注意力。此外,提出了一种善于适应显式空间先验的注意力分解形式,旨在不破坏空间衰减矩阵的情况下降低建模全局信息的计算负担。基于空间衰减矩阵和注意力分解形式,我们可以以线性复杂度将显式空间先验灵活地集成到视觉骨干网络中。大量实验表明,RMT在各种视觉任务上展现出卓越性能。具体而言,在无额外训练数据的情况下,RMT在ImageNet-1k上以**27M/4.5GFLOPs**和**96M/18.2GFLOPs**分别取得**84.8%**和**86.1%**的top-1准确率。对于下游任务,RMT在COCO检测任务上取得**54.5** box AP和**47.2** mask AP,在ADE20K语义分割任务上取得**52.8** mIoU。代码见 https://github.com/qhfan/RMT
引用
@article{arxiv.2309.11523,
title = {RMT: Retentive Networks Meet Vision Transformers},
author = {Qihang Fan and Huaibo Huang and Mingrui Chen and Hongmin Liu and Ran He},
journal= {arXiv preprint arXiv:2309.11523},
year = {2025}
}
备注
The paper is accepted by CVPR2024. Code is available at https://github.com/qhfan/RMT