中文

MAViL:掩码音视频学习器

计算机视觉与模式识别 2023-07-18 v2 多媒体 声音 音频与语音处理

摘要

我们提出掩码音视频学习器(MAViL)来训练音视频表示。我们的方法通过三种互补的自监督形式进行学习:(1)对掩码音频与视频输入数据的重建,(2)带掩码的模态内与模态间对比学习,以及(3)通过重建由前两个目标学习到的联合音视频上下文特征进行自训练。使用 MAViL 进行预训练不仅使模型在音视频分类与检索任务上表现良好,还改善了各模态孤立情况下的表示,且在微调或推理时无需使用另一模态的信息。在经验上,MAViL 在 AudioSet(53.1 mAP)和 VGGSound(67.1% 准确率)上确立了新的最先进水平。这是自监督音视频模型首次在这些基准上超越使用外部监督的模型。

关键词

引用

@article{arxiv.2212.08071,
  title  = {MAViL: Masked Audio-Video Learners},
  author = {Po-Yao Huang and Vasu Sharma and Hu Xu and Chaitanya Ryali and Haoqi Fan and Yanghao Li and Shang-Wen Li and Gargi Ghosh and Jitendra Malik and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2212.08071},
  year   = {2023}
}

备注

Technical report