论电影音频-视觉对比学习中的负采样
计算机视觉与模式识别
2022-05-03 v1
摘要
声音的丰富性及其易于利用的特点,加之听觉线索能揭示场景中发生的大量信息,使得音视频空间成为表征学习的直观选择。在本文中,我们探索了从未筛选的长视频内容(即电影)中进行音视频自监督学习的有效性。通过研究其与常规短视频内容的差异,我们识别出由电影本质驱动的非独立同分布数据。具体而言,我们发现长视频内容自然包含多样的语义概念(语义多样性),其中如主要角色和场景等大量概念常在整部电影中频繁重现(重现语义概念)。此外,电影常包含内容专属的艺术伪影,如调色板或主题音乐,这些是独特区分电影的强大信号(非语义一致性)。利用这些观察,我们全面研究了在对比学习设置中强调电影内负采样的效果。我们的观点不同于先前受语义随时间持续性概念启发、在短视频机制下考虑视频内正采样的工作。我们的实证结果表明,经某些修改后,在未筛选长视频上训练所得的表征,在迁移至多种动作识别与音频分类任务时,可与最先进(SOTA)方法竞争。
引用
@article{arxiv.2205.00073,
title = {On Negative Sampling for Audio-Visual Contrastive Learning from Movies},
author = {Mahdi M. Kalayeh and Shervin Ardeshir and Lingyi Liu and Nagendra Kamath and Ashok Chandrashekar},
journal= {arXiv preprint arXiv:2205.00073},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2106.08513