中文

全局-局部视频表示的对比学习

机器学习 2021-10-29 v2 计算机视觉与模式识别 声音 音频与语音处理 图像与视频处理

摘要

对比学习已在自监督范式下的各类任务中取得令人印象深刻的成果。然而,现有方法针对下游场景所需的表示进行优化,即适用于分类等任务的全局表示,或适用于检测与定位等任务的局部表示。尽管它们在预期的下游场景中产生满意结果,却常无法泛化至并非最初设计所针对的任务。本工作中,我们提出学习可泛化至既需要全局语义信息(如分类)又需要局部细粒度时空信息(如定位)的任务的视频表示。我们通过优化两个对比目标实现此点,二者共同促使模型在给定音频信号下学习全局-局部视觉信息。我们展示两个目标相互提升所学全局-局部表示的泛化性,显著优于各自独立学习的对应表示。我们在动作/声音分类、唇读、深度伪造检测、事件与声音定位等多项任务上演示了我们的方法(https://github.com/yunyikristy/global_local)。

关键词

引用

@article{arxiv.2104.05418,
  title  = {Contrastive Learning of Global-Local Video Representations},
  author = {Shuang Ma and Zhaoyang Zeng and Daniel McDuff and Yale Song},
  journal= {arXiv preprint arXiv:2104.05418},
  year   = {2021}
}