中文

用于音视频动作识别的自监督对比学习

计算机视觉与模式识别 2023-03-21 v2

摘要

音频与视觉模态间的内在相关性可用于为无标签视频学习监督信息。本文提出一种名为音视频对比学习(AVCL)的端到端自监督框架,以学习用于动作识别的判别性音视频表征。具体而言,我们设计了一个基于注意力的多模态融合模块(AMFM)来融合音频与视觉模态。为对齐异构的音视频模态,我们构建了新颖的共相关引导表征对齐模块(CGRA)。为从无标签视频中学习监督信息,我们提出了新颖的自监督对比学习模块(SelfCL)。此外,我们构建了一个名为 Kinetics-Sounds100 的新音视频动作识别数据集。在 Kinetics-Sounds32 与 Kinetics-Sounds100 数据集上的实验结果证明了我们的 AVCL 在大规模动作识别基准上优于当前最优(SOTA)方法。

关键词

引用

@article{arxiv.2204.13386,
  title  = {Self-supervised Contrastive Learning for Audio-Visual Action Recognition},
  author = {Yang Liu and Ying Tan and Haoyuan Lan},
  journal= {arXiv preprint arXiv:2204.13386},
  year   = {2023}
}

备注

6 pages, 2 figures