ACAV100M:用于音视频视频表征学习的大规模数据集自动策展
计算机视觉与模式识别
2021-08-18 v3
摘要
视觉观测与其对应声音之间的自然关联为学习视频表征提供了强大的自监督信号,这使得不断增长的在线视频成为有吸引力的训练数据来源。然而,由于编辑/后期配音音频,在线视频的很大一部分包含不相关的音视频信号,并且在此类未策展视频上训练的模型已被证明学习到次优表征。因此,现有方法几乎完全依赖于具有预定语义概念分类体系的数据集,其中音视频对应概率较高。不幸的是,构建此类数据集需要劳动密集型的手动标注和/或验证,这严重限制了在线视频在大规模学习中的效用。在这项工作中,我们提出一种基于子集优化的自动数据集策展方法,其目标是最大化视频中音频和视觉通道的互信息。我们证明了我们的方法能找到具有高音视频对应的视频,并表明在我们数据上训练的自监督模型与在现有手动策展数据集上训练的模型相比取得了有竞争力的性能。我们方法最显著的好处是可扩展性:我们发布了ACAV100M,其包含1亿个具有高音视频对应的视频,非常适合于自监督视频表征学习。
引用
@article{arxiv.2101.10803,
title = {ACAV100M: Automatic Curation of Large-Scale Datasets for Audio-Visual Video Representation Learning},
author = {Sangho Lee and Jiwan Chung and Youngjae Yu and Gunhee Kim and Thomas Breuel and Gal Chechik and Yale Song},
journal= {arXiv preprint arXiv:2101.10803},
year = {2021}
}
备注
Published to ICCV2021