用于音视觉事件定位的双模态 seq2seq 网络
计算机视觉与模式识别
2020-08-07 v2
摘要
音视觉事件定位要求识别视频中(帧级或视频级)既可见又可听的event。为应对该任务,我们提出名为音视觉序列到序列双网络(AVSDN)的深度神经网络。通过联合将每个时间段的音频与视觉特征作为输入,我们提出的模型以序列到序列方式学习全局与局部事件信息,可在全监督或弱监督设定下实现。实证结果证实,我们所提方法在两种设定下均优于近期深度学习方法。
关键词
引用
@article{arxiv.1902.07473,
title = {Dual-modality seq2seq network for audio-visual event localization},
author = {Yan-Bo Lin and Yu-Jhe Li and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:1902.07473},
year = {2020}
}
备注
Accepted in ICASSP 2019