基于联合协同注意力递归融合的音视事件定位
计算机视觉与模式识别
2020-08-18 v1 声音
音频与语音处理
摘要
音视事件定位任务的主要挑战在于如何有效地融合来自多模态的信息。近期工作表明注意力机制有益于融合过程。在本文中,我们提出了一种用于音视事件定位的带有多模态融合方法的新型联合注意力机制。特别地,我们提出了一种简洁而有效的架构,以联合方式从多模态中有效学习表示。首先,视觉特征与听觉特征结合并转化为联合表示。接下来,我们利用联合表示分别关注视觉特征和听觉特征。借助该联合协同注意力,生成了新的视觉和听觉特征,从而两者均可从彼此获得相互改进的益处。值得注意的是,联合协同注意力单元是递归的,意味着它可以被执行多次以逐步获得更好的联合表示。在公开 AVE 数据集上的大量实验表明,所提方法取得了显著优于当前最优方法的结果。
引用
@article{arxiv.2008.06581,
title = {Audio-Visual Event Localization via Recursive Fusion by Joint Co-Attention},
author = {Bin Duan and Hao Tang and Wei Wang and Ziliang Zong and Guowei Yang and Yan Yan},
journal= {arXiv preprint arXiv:2008.06581},
year = {2020}
}