UniFormer:统一卷积与自注意力以实现视觉识别
摘要
由于视觉数据中巨大的局部冗余与复杂的全局依赖,从图像和视频中学习判别性表示是一项具有挑战性的任务。卷积神经网络(CNNs)与视觉Transformer(ViTs)在过去几年中成为两个主导框架。尽管CNNs可通过小邻域内的卷积有效降低局部冗余,但有限的感受野使其难以捕捉全局依赖。相反,ViTs可通过自注意力有效捕获长程依赖,而对所有token的盲目相似性比较导致了高冗余。为解决这些问题,我们提出了一种新颖的统一Transformer(UniFormer),其能以简洁的Transformer形式无缝融合卷积与自注意力的优势。不同于典型的Transformer块,我们的UniFormer块中的关系聚合器分别在浅层与深层配备局部与全局token亲和度,从而能够处理冗余与依赖以实现高效且有效的表示学习。最后,我们将UniFormer块灵活堆叠为一个强大的新骨干网络,并将其应用于从图像到视频域、从分类到密集预测的各种视觉任务。在无任何额外训练数据的情况下,我们的UniFormer在ImageNet-1K分类上达到86.3的top-1准确率。仅使用ImageNet-1K预训练,它便可在广泛下游任务中简单取得最先进性能,例如,在Kinetics-400/600上获得82.9/84.8的top-1准确率,在Sth-Sth V1/V2视频分类上获得60.9/71.2的top-1准确率,在COCO目标检测上获得53.8 box AP与46.4 mask AP,在ADE20K语义分割上获得50.8 mIoU,以及在COCO姿态估计上获得77.4 AP。我们进一步构建了吞吐量高2-4倍的高效UniFormer。代码见 https://github.com/Sense-X/UniFormer。
引用
@article{arxiv.2201.09450,
title = {UniFormer: Unifying Convolution and Self-attention for Visual Recognition},
author = {Kunchang Li and Yali Wang and Junhao Zhang and Peng Gao and Guanglu Song and Yu Liu and Hongsheng Li and Yu Qiao},
journal= {arXiv preprint arXiv:2201.09450},
year = {2024}
}
备注
18 pages, 10 figures, 23 tables. This work has been submitted to the IEEE for possible publication