中文

MM-Pyramid:用于音视频事件定位与视频解析的多模态金字塔注意力网络

计算机视觉与模式识别 2022-07-13 v2

摘要

识别并定位视频中的事件是视频理解的一项基础任务。由于事件可能发生在听觉和视觉模态中,多模态的细致感知对于完整的场景理解至关重要。以往大多数工作试图从整体角度分析视频,但未考虑多尺度的语义信息,这使得模型难以定位不同长度的事件。本文提出了一种用于事件定位的多模态金字塔注意力网络(MM-Pyramid)。具体而言,我们首先提出了注意力特征金字塔模块。该模块通过多个堆叠的金字塔单元捕获时序金字塔特征,每个单元由一个固定尺寸的注意力块和一个膨胀卷积块组成。我们还设计了一个自适应语义融合模块,利用单元级注意力块和选择性融合块以交互方式整合金字塔特征。在音视频事件定位和弱监督音视频视频解析任务上的大量实验验证了所提方法的有效性。

关键词

引用

@article{arxiv.2111.12374,
  title  = {MM-Pyramid: Multimodal Pyramid Attentional Network for Audio-Visual Event Localization and Video Parsing},
  author = {Jiashuo Yu and Ying Cheng and Rui-Wei Zhao and Rui Feng and Yuejie Zhang},
  journal= {arXiv preprint arXiv:2111.12374},
  year   = {2022}
}

备注

ACM MM 2022