中文

论电影音频-视觉对比学习中的负采样

计算机视觉与模式识别 2022-05-03 v1

摘要

声音的丰富性及其易于利用的特点,加之听觉线索能揭示场景中发生的大量信息,使得音视频空间成为表征学习的直观选择。在本文中,我们探索了从未筛选的长视频内容(即电影)中进行音视频自监督学习的有效性。通过研究其与常规短视频内容的差异,我们识别出由电影本质驱动的非独立同分布数据。具体而言,我们发现长视频内容自然包含多样的语义概念(语义多样性),其中如主要角色和场景等大量概念常在整部电影中频繁重现(重现语义概念)。此外,电影常包含内容专属的艺术伪影,如调色板或主题音乐,这些是独特区分电影的强大信号(非语义一致性)。利用这些观察,我们全面研究了在对比学习设置中强调电影内负采样的效果。我们的观点不同于先前受语义随时间持续性概念启发、在短视频机制下考虑视频内正采样的工作。我们的实证结果表明,经某些修改后,在未筛选长视频上训练所得的表征,在迁移至多种动作识别与音频分类任务时,可与最先进(SOTA)方法竞争。

关键词

引用

@article{arxiv.2205.00073,
  title  = {On Negative Sampling for Audio-Visual Contrastive Learning from Movies},
  author = {Mahdi M. Kalayeh and Shervin Ardeshir and Lingyi Liu and Nagendra Kamath and Ashok Chandrashekar},
  journal= {arXiv preprint arXiv:2205.00073},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2106.08513