中文

MViTv2:用于分类与检测的改进多尺度视觉 Transformer

计算机视觉与模式识别 2022-03-31 v2

摘要

本文中,我们研究多尺度视觉 Transformer(MViTv2)作为一种统一的架构,用于图像与视频分类以及目标检测。我们提出了 MViT 的改进版本,其融合了分解的相对位置嵌入与残差池化连接。我们以五种规模实例化该架构,并在 ImageNet 分类、COCO 检测和 Kinetics 视频识别上评估,其优于先前工作。我们进一步将 MViTv2 的池化注意力与窗口注意力机制比较,其在准确率/计算量上优于后者。无需额外技巧,MViTv2 在 3 个领域具有最先进性能:ImageNet 分类 88.8% 准确率、COCO 目标检测 58.7 boxAP 以及 Kinetics-400 视频分类 86.1%。代码与模型见 https://github.com/facebookresearch/mvit。

关键词

引用

@article{arxiv.2112.01526,
  title  = {MViTv2: Improved Multiscale Vision Transformers for Classification and Detection},
  author = {Yanghao Li and Chao-Yuan Wu and Haoqi Fan and Karttikeya Mangalam and Bo Xiong and Jitendra Malik and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2112.01526},
  year   = {2022}
}

备注

CVPR 2022 Camera Ready