MViTv2:用于分类与检测的改进多尺度视觉 Transformer
计算机视觉与模式识别
2022-03-31 v2
摘要
本文中,我们研究多尺度视觉 Transformer(MViTv2)作为一种统一的架构,用于图像与视频分类以及目标检测。我们提出了 MViT 的改进版本,其融合了分解的相对位置嵌入与残差池化连接。我们以五种规模实例化该架构,并在 ImageNet 分类、COCO 检测和 Kinetics 视频识别上评估,其优于先前工作。我们进一步将 MViTv2 的池化注意力与窗口注意力机制比较,其在准确率/计算量上优于后者。无需额外技巧,MViTv2 在 3 个领域具有最先进性能:ImageNet 分类 88.8% 准确率、COCO 目标检测 58.7 boxAP 以及 Kinetics-400 视频分类 86.1%。代码与模型见 https://github.com/facebookresearch/mvit。
引用
@article{arxiv.2112.01526,
title = {MViTv2: Improved Multiscale Vision Transformers for Classification and Detection},
author = {Yanghao Li and Chao-Yuan Wu and Haoqi Fan and Karttikeya Mangalam and Bo Xiong and Jitendra Malik and Christoph Feichtenhofer},
journal= {arXiv preprint arXiv:2112.01526},
year = {2022}
}
备注
CVPR 2022 Camera Ready