非受限视频中的视听事件定位
计算机视觉与模式识别
2018-03-26 v1
摘要
在本文中,我们引入了非受限视频中视听事件定位这一新颖问题。我们将视听事件定义为在视频片段中既可见又可闻的事件。我们收集了一个视听事件(AVE)数据集,以系统地研究三个时序定位任务:有监督和弱监督的视听事件定位,以及跨模态定位。我们开发了音频引导的视觉注意力机制来探索视听相关性,提出了双多模态残差网络(DMRN)以融合两种模态上的信息,并引入了视听距离学习网络来处理跨模态定位。我们的实验支持以下发现:听觉和视觉模态的联合建模优于独立建模,所学到的注意力能够捕捉发声物体的语义,时序对齐对于视听融合很重要,所提出的 DMRN 在融合视听特征方面是有效的,且两种模态之间的强相关性使得跨模态定位成为可能。
引用
@article{arxiv.1803.08842,
title = {Audio-Visual Event Localization in Unconstrained Videos},
author = {Yapeng Tian and Jing Shi and Bochen Li and Zhiyao Duan and Chenliang Xu},
journal= {arXiv preprint arXiv:1803.08842},
year = {2018}
}
备注
23 pages, 7 figures