用于音视频动作识别的自监督对比学习
计算机视觉与模式识别
2023-03-21 v2
摘要
音频与视觉模态间的内在相关性可用于为无标签视频学习监督信息。本文提出一种名为音视频对比学习(AVCL)的端到端自监督框架,以学习用于动作识别的判别性音视频表征。具体而言,我们设计了一个基于注意力的多模态融合模块(AMFM)来融合音频与视觉模态。为对齐异构的音视频模态,我们构建了新颖的共相关引导表征对齐模块(CGRA)。为从无标签视频中学习监督信息,我们提出了新颖的自监督对比学习模块(SelfCL)。此外,我们构建了一个名为 Kinetics-Sounds100 的新音视频动作识别数据集。在 Kinetics-Sounds32 与 Kinetics-Sounds100 数据集上的实验结果证明了我们的 AVCL 在大规模动作识别基准上优于当前最优(SOTA)方法。
引用
@article{arxiv.2204.13386,
title = {Self-supervised Contrastive Learning for Audio-Visual Action Recognition},
author = {Yang Liu and Ying Tan and Haoyuan Lan},
journal= {arXiv preprint arXiv:2204.13386},
year = {2023}
}
备注
6 pages, 2 figures