中文

面向音视事件定位的多调制网络

计算机视觉与模式识别 2021-08-31 v2

摘要

我们研究视频中可听且可见的音视事件定位问题。现有工作聚焦于在片段层级编码并对齐音频与视觉特征,忽视了两种模态各片段之间以及多尺度事件提议之间的信息相关性。我们提出一种新颖的多调制网络(M2N)来学习上述相关性,并将其用作语义引导以调制相关的听觉、视觉及融合特征。具体而言,在特征编码阶段,我们提出跨模态归一化与模态内归一化。前者通过建立并利用跨模态关系来调制两模态特征;后者利用同模态中与事件相关的语义引导来调制单模态特征。在融合阶段,我们提出多尺度提议调制模块与多对齐片段调制模块,以引入多尺度事件提议并实现跨模态片段间的稠密匹配。借助由音视事件相关性信息调制的听觉、视觉及融合特征,M2N 实现了精准的事件定位。在 AVE 数据集上的大量实验表明,我们所提方法在有监督事件定位与跨模态定位上均优于当前最优方法。

关键词

引用

@article{arxiv.2108.11773,
  title  = {Multi-Modulation Network for Audio-Visual Event Localization},
  author = {Hao Wang and Zheng-Jun Zha and Liang Li and Xuejin Chen and Jiebo Luo},
  journal= {arXiv preprint arXiv:2108.11773},
  year   = {2021}
}