过去与未来运动引导的视听事件定位网络
计算机视觉与模式识别
2022-05-10 v1
摘要
近年来,视听事件定位吸引了大量关注。其目的在于从未经裁剪的视频中检测出包含视听事件的片段并识别事件类别。现有方法利用音频引导的视觉注意力使模型关注正在进行事件的空间区域,致力于音频与视觉信息间的相关性,却忽略了音频与空间运动间的相关性。我们提出了一种过去与未来运动提取(pf-ME)模块以从视频中挖掘视觉运动,将其嵌入过去与未来运动引导网络(PFAGN),并提出运动引导音频注意力(MGAA)模块,通过过去与未来的视觉运动实现对音频模态中与感兴趣事件相关信息聚焦。我们选择 AVE 作为实验验证数据集,实验表明我们的方法在监督与弱监督设定下均优于现有最优方法(SOTA)。
引用
@article{arxiv.2205.03802,
title = {Past and Future Motion Guided Network for Audio Visual Event Localization},
author = {Tingxiu Chen and Jianqin Yin and Jin Tang},
journal= {arXiv preprint arXiv:2205.03802},
year = {2022}
}
备注
event localization, multi-modal learning, audio-visual learning, audio attention, motion extraction