中文

通过组合对比学习蒸馏音视频知识

计算机视觉与模式识别 2021-04-23 v1 人工智能 机器学习

摘要

与从单一模态学习相比,获取多模态线索(如视觉和音频)使某些认知任务能够更快完成。在这项工作中,我们提出跨异构模态迁移知识,即使这些数据模态可能在语义上不相关。我们不是直接对齐不同模态的表示,而是跨模态组合音频、图像和视频表示,以揭示更丰富的多模态知识。我们的主要思想是学习一个组合嵌入,缩小跨模态语义鸿沟并捕获与任务相关的语义,从而通过组合对比学习将跨模态的表示拉到一起。我们在三个视频数据集上建立了一个新的、全面的模态蒸馏基准:UCF101、ActivityNet和VGGSound。此外,我们证明我们的模型在将音视频知识迁移以改进视频表示学习方面,显著优于多种现有的知识蒸馏方法。代码发布于:https://github.com/yanbeic/CCL。

关键词

引用

@article{arxiv.2104.10955,
  title  = {Distilling Audio-Visual Knowledge by Compositional Contrastive Learning},
  author = {Yanbei Chen and Yongqin Xian and A. Sophia Koepke and Ying Shan and Zeynep Akata},
  journal= {arXiv preprint arXiv:2104.10955},
  year   = {2021}
}

备注

Accepted to CVPR2021