面向模态特定标注视频中多模态动作识别的可学习无关模态丢弃
计算机视觉与模式识别
2022-03-29 v2
摘要
在视频数据集为多模态标注(听觉与视觉模态均被标注或与类别相关)的假设下,当前多模态方法采用模态融合或跨模态注意力。然而,在仅视觉标注的视频中有效利用音频模态进行动作识别尤其具有挑战性。为应对该挑战,我们提出一种新颖的音视框架,可在任意仅视觉标注的数据集中有效利用音频模态。我们采用语言模型(如 BERT)构建语义音视标签字典(SAVLD),将每个视频标签映射到其最相关的 K 个音频标签,其中 SAVLD 充当音频与视频数据集间的桥梁。随后,在训练阶段,利用 SAVLD 与预训练的音频多标签模型估计音视频模态相关性。据此,提出一种新颖的可学习无关模态丢弃(IMD)以完全丢弃无关音频模态并仅融合相关模态。此外,我们提出一种新的双流视频 Transformer 以高效建模视觉模态。在包括 Kinetics400 与 UCF-101 在内的若干仅视觉标注数据集上的结果验证了我们的框架,其优于大多数相关动作识别方法。
引用
@article{arxiv.2203.03014,
title = {Learnable Irrelevant Modality Dropout for Multimodal Action Recognition on Modality-Specific Annotated Videos},
author = {Saghir Alfasly and Jian Lu and Chen Xu and Yuru Zou},
journal= {arXiv preprint arXiv:2203.03014},
year = {2022}
}
备注
CVPR 2022