中文

VATT:基于原始视频、音频与文本的多模态自监督学习Transformer

计算机视觉与模式识别 2021-12-08 v3 人工智能 机器学习 多媒体 图像与视频处理

摘要

我们提出一个使用无卷积Transformer架构从无标签数据学习多模态表示的框架。具体而言,我们的视频-音频-文本Transformer(VATT)以原始信号为输入,提取足以惠及多种下游任务的丰富多模态表示。我们使用多模态对比损失从头端到端训练VATT,并通过视频动作识别、音频事件分类、图像分类与文本到视频检索等下游任务评估其性能。此外,我们研究了一种模态不可知、单一骨干Transformer,通过在三种模态间共享权重实现。我们展示无卷积VATT在下游任务中优于最先进的基于ConvNet的架构。特别地,VATT的视觉Transformer在Kinetics-400上取得82.1%的top-1准确率,在Kinetics-600上83.6%,在Kinetics-700上72.7%,在Moments in Time上41.1%,在避免监督预训练的同时创下新纪录。迁移至图像分类在ImageNet上取得78.7%的top-1准确率,而从头训练同一Transformer仅得64.7%,显示出尽管视频与图像间存在域差距,我们的模型仍具泛化性。VATT的音频Transformer亦在无任何监督预训练下以AudioSet上39.4%的mAP创下基于波形的音频事件识别新纪录。VATT源代码公开可用。

关键词

引用

@article{arxiv.2104.11178,
  title  = {VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text},
  author = {Hassan Akbari and Liangzhe Yuan and Rui Qian and Wei-Hong Chuang and Shih-Fu Chang and Yin Cui and Boqing Gong},
  journal= {arXiv preprint arXiv:2104.11178},
  year   = {2021}
}

备注

Published in the 35th Conference on Neural Information Processing Systems (NeurIPS 2021)