中文

MPN:用于音视事件定位的多模态并行网络

计算机视觉与模式识别 2021-04-08 v1 人工智能 多媒体

摘要

音视事件定位旨在定位野外既可听又可见的事件,这是针对无约束视频的一项广泛的音视场景分析任务。为应对该任务,我们提出一种多模态并行网络(MPN),可并行感知全局语义与未混合的局部信息。具体而言,我们的 MPN 框架由一个用于预测事件类别的分类子网络和一个用于预测事件边界的定位子网络构成。分类子网络由多模态协同注意力模块(MCM)构建并获得全局上下文。定位子网络由多模态瓶颈注意力模块(MBAM)组成,其设计用于提取细粒度片段级内容。大量实验表明,我们的框架在音视事件(AVE)数据集上于全监督与弱监督设定下均取得了最先进(SOTA)性能。

关键词

引用

@article{arxiv.2104.02971,
  title  = {MPN: Multimodal Parallel Network for Audio-Visual Event Localization},
  author = {Jiashuo Yu and Ying Cheng and Rui Feng},
  journal= {arXiv preprint arXiv:2104.02971},
  year   = {2021}
}

备注

IEEE International Conference on Multimedia and Expo (ICME) 2021 Oral