用于音视频分类的高效多尺度多模态瓶颈Transformer
计算机视觉与模式识别
2024-01-09 v1 人工智能
机器学习
多媒体
声音
音频与语音处理
摘要
近年来,研究者结合音频和视频信号来应对视觉线索无法充分表示或捕捉动作的挑战。然而,如何有效利用这两种模态仍处于发展阶段。在这项工作中,我们开发了一种利用分层表示学习的多尺度多模态Transformer(MMT)。具体而言,MMT由一个新颖的多尺度音频Transformer(MAT)和一个多尺度视频Transformer[43]组成。为了学习具有判别力的跨模态融合,我们进一步设计了多模态监督对比目标,称为音视频对比损失(AVC)和模态内对比损失(IMC),以稳健地对齐两种模态。在不使用外部训练数据的情况下,MMT在Kinetics-Sounds和VGGSound上的top-1准确率分别比以往最先进的方法高出7.3%和2.1%。此外,所提出的MAT在三个公开基准数据集上分别以22.2%、4.4%和4.7%的显著优势超越了AST[28],并且基于FLOPs数量效率提高约3%,基于GPU内存使用效率提高9.8%。
引用
@article{arxiv.2401.04023,
title = {Efficient Multiscale Multimodal Bottleneck Transformer for Audio-Video Classification},
author = {Wentao Zhu},
journal= {arXiv preprint arXiv:2401.04023},
year = {2024}
}
备注
Accepted by WACV 2024; well-formatted PDF is in https://drive.google.com/file/d/10Zo_ydJZFAm7YsxHDgTjhyc4dEJbW_dk/view?usp=sharing