中文

音视频掩码自编码器

计算机视觉与模式识别 2024-01-05 v3 声音

摘要

我们能否利用视频中已有的音视频信息来改进自监督表示学习?为回答这一问题,我们受类似方法在自然语言和图像理解中成功的启发,在掩码自编码框架下研究了多种预训练架构与目标。我们表明,我们可以在音视频下游分类任务上取得显著提升,在 VGGSound 和 AudioSet 上超越当前最优(state-of-the-art, SOTA)方法。此外,我们可以利用我们的音视频预训练方案,通过单一的音视频预训练模型服务于多个单模态下游任务。我们还展示了我们表示的可迁移性,在 Epic Kitchens 上取得了当前最优的音视频结果,而无需专门针对该数据集进行预训练。

关键词

引用

@article{arxiv.2212.05922,
  title  = {Audiovisual Masked Autoencoders},
  author = {Mariana-Iuliana Georgescu and Eduardo Fonseca and Radu Tudor Ionescu and Mario Lucic and Cordelia Schmid and Anurag Arnab},
  journal= {arXiv preprint arXiv:2212.05922},
  year   = {2024}
}

备注

ICCV 2023