中文

MMViT:多尺度多视角视觉 Transformer

计算机视觉与模式识别 2023-05-02 v1 音频与语音处理 图像与视频处理

摘要

我们提出多尺度多视角视觉 Transformer(MMViT),将多尺度特征图和多视角编码引入 transformer 模型。我们的模型对输入信号的不同视角进行编码,并构建若干通道-分辨率特征阶段,以并行处理不同分辨率下输入的多个视角。在每个尺度阶段,我们使用交叉注意力块来融合不同视角间的信息。这使 MMViT 模型能够在不同分辨率下获取输入复杂的的高维表示。所提模型可作为多领域中的骨干模型。我们在音频和图像分类任务上展示了 MMViT 的有效性,取得了最先进的结果。

关键词

引用

@article{arxiv.2305.00104,
  title  = {MMViT: Multiscale Multiview Vision Transformers},
  author = {Yuchen Liu and Natasha Ong and Kaiyan Peng and Bo Xiong and Qifan Wang and Rui Hou and Madian Khabsa and Kaiyue Yang and David Liu and Donald S. Williamson and Hanchao Yu},
  journal= {arXiv preprint arXiv:2305.00104},
  year   = {2023}
}