用于音视频事件识别的多层级注意力融合网络
计算机视觉与模式识别
2021-06-15 v1 多媒体
摘要
事件分类本质上是序列性的且多模态的。因此,深度神经模型需要动态聚焦于视频中最相关的时间窗口和/或模态。在本研究中,我们提出了多层级注意力融合网络(MAFnet),一种能够动态融合视觉与音频信息用于事件识别的架构。受先前神经科学研究的启发,我们在视觉与音频路径的不同层级上耦合两种模态。此外,该网络在给定时间窗口动态高亮与事件分类相关的模态。在 AVE(Audio-Visual Event)、UCF51 和 Kinetics-Sounds 数据集上的实验结果表明,该方法能有效提升音视频事件分类的准确率。代码见:https://github.com/numediart/MAFnet
引用
@article{arxiv.2106.06736,
title = {Multi-level Attention Fusion Network for Audio-visual Event Recognition},
author = {Mathilde Brousmiche and Jean Rouat and Stéphane Dupont},
journal= {arXiv preprint arXiv:2106.06736},
year = {2021}
}
备注
Preprint submitted to the Information Fusion journal in August 2020