中文

基于自监督同步的音频与视频模型协同学习

计算机视觉与模式识别 2018-11-13 v2

摘要

视频的视觉与听觉元素间存在天然关联。本工作中,我们利用该联系,从自监督的时间同步中学习通用且高效的音频与视频分析模型。我们证明,经过校准的课程学习方案、对负样本的谨慎选择以及对比损失的使用,是从经优化以辨别音视频对时间同步的模型中获取强大多感官表征的关键要素。无需进一步微调,所得音频特征在已确立的音频分类基准(DCASE2014 和 ESC-50)上取得了优于或媲美当前最优的性能。同时,我们的视觉子网络为提升基于视频的动作识别模型精度提供了非常有效的初始化:相较于从头学习,我们的自监督预训练在 UCF101 上带来了 +19.9% 的动作识别精度显著提升,在 HMDB51 上带来了 +17.7% 的增益。

关键词

引用

@article{arxiv.1807.00230,
  title  = {Cooperative Learning of Audio and Video Models from Self-Supervised Synchronization},
  author = {Bruno Korbar and Du Tran and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:1807.00230},
  year   = {2018}
}

备注

Note: Changed name - added experiments