中文

多尺度视觉 Transformer

计算机视觉与模式识别 2021-04-23 v1 人工智能 机器学习

摘要

我们提出多尺度视觉 Transformer(MViT)用于视频与图像识别,将多尺度特征层次这一开创性思想与 Transformer 模型相结合。多尺度 Transformer 具有若干通道-分辨率尺度阶段。从输入分辨率与较小通道维度出发,各阶段分层扩展通道容量同时降低空间分辨率。这构建了多尺度特征金字塔:早期层以高空间分辨率运作以建模简单的低级视觉信息,更深层层在空间上粗糙但复杂、高维的特征。我们针对多种视频识别任务评估这一基础架构先验以建模视觉信号的密集本质,其优于依赖大规模外部预训练且计算与参数成本高 5-10 倍的同期视觉 Transformer。我们进一步去除时间维度并将模型用于图像分类,优于先前视觉 Transformer 的工作。代码见:https://github.com/facebookresearch/SlowFast

关键词

引用

@article{arxiv.2104.11227,
  title  = {Multiscale Vision Transformers},
  author = {Haoqi Fan and Bo Xiong and Karttikeya Mangalam and Yanghao Li and Zhicheng Yan and Jitendra Malik and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2104.11227},
  year   = {2021}
}

备注

Technical report