基于跨模态音视频聚类的自监督学习
计算机视觉与模式识别
2020-10-27 v3
摘要
视觉与音频模态高度相关,但它们包含不同的信息。其强相关性使得以良好精度从一种模态预测另一种模态的语义成为可能。与模态内学习相比,其内在差异使得跨模态预测成为视频与音频表征自监督学习中潜在更有价值的 pretext 任务。基于这一直觉,我们提出跨模态深度聚类(XDC),一种新颖的自监督方法,该方法利用一种模态(如音频)中的无监督聚类作为另一模态(如视频)的监督信号。这种跨模态监督帮助 XDC 利用两种模态之间的语义相关性与差异。我们的实验表明,XDC 优于单模态聚类及其他多模态变体。XDC 在多个视频与音频基准上取得了自监督方法中最先进的准确率。最为重要的是,我们在大规模无标签数据上预训练的视频模型,在 HMDB51 与 UCF101 上的动作识别任务中,显著优于在相同架构下用 ImageNet 与 Kinetics 全监督预训练的模型。据我们所知,XDC 是首个在相同架构下于动作识别上超越大规模全监督预训练的自监督学习方法。
引用
@article{arxiv.1911.12667,
title = {Self-Supervised Learning by Cross-Modal Audio-Video Clustering},
author = {Humam Alwassel and Dhruv Mahajan and Bruno Korbar and Lorenzo Torresani and Bernard Ghanem and Du Tran},
journal= {arXiv preprint arXiv:1911.12667},
year = {2020}
}
备注
Accepted to NeurIPS 2020 (spotlight presentation)