Zorro:掩码多模态 Transformer
计算机视觉与模式识别
2023-02-23 v2
摘要
基于注意力的模型在多模态处理中颇具吸引力,因为来自多个模态的输入可被拼接并送入单一主干网络——从而只需极少的融合工程。然而由此得到的表示在整个网络中完全纠缠,这并非总是可取的:在学习中,对比式音视觉自监督学习需要独立的音频与视觉特征才能运作,否则学习会崩溃;在推断中,音视觉模型的评估应能在仅有音频或仅有视频的基准上进行。本文中,我们引入 Zorro,一种利用掩码控制各模态输入在 Transformer 内部路由、使表示的某些部分保持模态纯净的技术。我们将该技术应用于三种流行的基于 Transformer 的架构(ViT、Swin 与 HiP),并表明通过对比式预训练,Zorro 在多模态任务的最相关基准(AudioSet 与 VGGSound)上取得了 SOTA 结果。此外,所得模型能够在 Kinetics-400 或 ESC-50 等视频与音频基准上执行单模态推断。
引用
@article{arxiv.2301.09595,
title = {Zorro: the masked multimodal transformer},
author = {Adrià Recasens and Jason Lin and Joāo Carreira and Drew Jaegle and Luyu Wang and Jean-baptiste Alayrac and Pauline Luc and Antoine Miech and Lucas Smaira and Ross Hemsley and Andrew Zisserman},
journal= {arXiv preprint arXiv:2301.09595},
year = {2023}
}