音视频掩码自编码器
计算机视觉与模式识别
2024-01-05 v3 声音
摘要
我们能否利用视频中已有的音视频信息来改进自监督表示学习?为回答这一问题,我们受类似方法在自然语言和图像理解中成功的启发,在掩码自编码框架下研究了多种预训练架构与目标。我们表明,我们可以在音视频下游分类任务上取得显著提升,在 VGGSound 和 AudioSet 上超越当前最优(state-of-the-art, SOTA)方法。此外,我们可以利用我们的音视频预训练方案,通过单一的音视频预训练模型服务于多个单模态下游任务。我们还展示了我们表示的可迁移性,在 Epic Kitchens 上取得了当前最优的音视频结果,而无需专门针对该数据集进行预训练。
引用
@article{arxiv.2212.05922,
title = {Audiovisual Masked Autoencoders},
author = {Mariana-Iuliana Georgescu and Eduardo Fonseca and Radu Tudor Ionescu and Mario Lucic and Cordelia Schmid and Anurag Arnab},
journal= {arXiv preprint arXiv:2212.05922},
year = {2024}
}
备注
ICCV 2023