中文

多看影视剧有益:基于电影与电视剧的自监督视听表征学习

计算机视觉与模式识别 2021-06-17 v1

摘要

声音易于获取和利用,且听觉线索能揭示场景中大量信息,这使得视听空间成为自监督表征学习极为直观的选择。然而,现有文献表明,在未经筛选(uncurated)的数据上训练得到的表征,相比以监督方式收集的经过筛选(curated)的替代数据,质量明显更差,且只有当数据量显著增大时差距才会缩小。此外,已知所学表征的质量深受用于自监督训练的筛选数据集的规模与分类体系影响。这引出一个问题:当我们的自监督努力仍几乎完全依赖筛选数据时,我们是否过早庆祝已赶上监督学习?本文中,我们研究以电影和电视剧作为未经筛选数据进行视听自监督学习的效果。我们证明,一个基于对比学习的简单模型,在电影与电视剧集合上训练后,不仅大幅优于在数量级更大的未经筛选数据集上训练的更复杂方法,而且与从大规模筛选数据学习的最先进(state-of-the-art)方法相比也极具竞争力。我们识别出,诸如主角出场、突出场景以及场面调度(mise-en-scène)等贯穿整部影片频繁出现的视听模式,会在对比学习公式中导致过多易负样本。利用这一观察,我们提出一种分层采样策略,尽管简单,却有效提升了性能,尤其在语义多样性天然较少的电视剧上学习时。

关键词

引用

@article{arxiv.2106.08513,
  title  = {Watching Too Much Television is Good: Self-Supervised Audio-Visual Representation Learning from Movies and TV Shows},
  author = {Mahdi M. Kalayeh and Nagendra Kamath and Lingyi Liu and Ashok Chandrashekar},
  journal= {arXiv preprint arXiv:2106.08513},
  year   = {2021}
}