中文

用于音视觉事件定位的双模态 seq2seq 网络

计算机视觉与模式识别 2020-08-07 v2

摘要

音视觉事件定位要求识别视频中(帧级或视频级)既可见又可听的event。为应对该任务,我们提出名为音视觉序列到序列双网络(AVSDN)的深度神经网络。通过联合将每个时间段的音频与视觉特征作为输入,我们提出的模型以序列到序列方式学习全局与局部事件信息,可在全监督或弱监督设定下实现。实证结果证实,我们所提方法在两种设定下均优于近期深度学习方法。

关键词

引用

@article{arxiv.1902.07473,
  title  = {Dual-modality seq2seq network for audio-visual event localization},
  author = {Yan-Bo Lin and Yu-Jhe Li and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:1902.07473},
  year   = {2020}
}

备注

Accepted in ICASSP 2019