中文

音视频视频表示的主动对比学习

机器学习 2021-04-20 v2 计算机视觉与模式识别

摘要

对比学习已被证明可通过最大化同一实例不同视图间互信息(MI)的下界来产生音频与视觉数据的可泛化表示。然而,获得紧下界需要样本量随 MI 呈指数增长,从而需要大量负样本。我们可通过构建基于队列的大型字典来纳入更多样本,但即便拥有大量负样本,性能提升仍存在理论极限。我们假设随机负采样会导致高度冗余的字典,从而造成下游任务上的次优表示。本文提出一种主动对比学习方法,其构建具有多样且信息丰富条目的主动采样字典,从而改善负样本质量,并提升在数据具有高互信息的任务(如视频分类)上的性能。我们的模型在包括 UCF101、HMDB51 与 ESC50 在内的具有挑战性的音频与视觉下游基准上取得了最先进的性能。\footnote{代码见:\url{https://github.com/yunyikristy/CM-ACC}}

关键词

引用

@article{arxiv.2009.09805,
  title  = {Active Contrastive Learning of Audio-Visual Video Representations},
  author = {Shuang Ma and Zhaoyang Zeng and Daniel McDuff and Yale Song},
  journal= {arXiv preprint arXiv:2009.09805},
  year   = {2021}
}