中文

用于音视频分类的高效选择性音频掩码多模态瓶颈Transformer

计算机视觉与模式识别 2024-01-10 v1 人工智能 机器学习 多媒体 声音 音频与语音处理

摘要

音频和视频是主流媒体平台(如YouTube)中最常见的两种模态。为了有效地从多模态视频中学习,在这项工作中,我们提出了一种新颖的音视频识别方法,称为音视频Transformer(AVT),利用视频Transformer有效的时空表示来提高动作识别精度。对于多模态融合,在跨模态Transformer中简单拼接多模态令牌需要大量的计算和内存资源,我们转而通过一个音视频瓶颈Transformer来降低跨模态复杂度。为了提高多模态Transformer的学习效率,我们将自监督目标(即音视频对比学习、音视频匹配以及掩码音频和视频学习)集成到AVT训练中,将多样的音频和视频表示映射到一个共同的多模态表示空间。我们进一步提出了一个掩码音频片段损失来学习AVT中的语义音频活动。在三个公开数据集和两个内部数据集上的大量实验和消融研究一致证明了所提出的AVT的有效性。具体而言,AVT在Kinetics-Sounds上比其先前最先进的同类方法性能提升了8%。通过利用音频信号,AVT在VGGSound上也比先前最先进的视频Transformer之一[25]性能提升了10%。与先前最先进的多模态方法之一MBT[32]相比,AVT在FLOPs上效率提高了1.3%,并在Epic-Kitchens-100上精度提升了3.8%。

关键词

引用

@article{arxiv.2401.04154,
  title  = {Efficient Selective Audio Masked Multimodal Bottleneck Transformer for Audio-Video Classification},
  author = {Wentao Zhu},
  journal= {arXiv preprint arXiv:2401.04154},
  year   = {2024}
}

备注

Accepted by WACV 2024; well-formatted PDF is in https://drive.google.com/file/d/1qvW52lamsvNGMCqPS7q8g8L4NaR_LlbR/view?usp=sharing. arXiv admin note: text overlap with arXiv:2401.04023