中文

用于接地视频字幕生成的时空注意力模型

计算机视觉与模式识别 2016-10-19 v2

摘要

自动视频字幕生成因动态真实场景中的复杂交互而具有挑战性。一个全面的系统最终应定位并跟踪视频中出现的物体、动作和交互,并生成依赖于时间定位的描述,以接地视觉概念。然而,大多数现有的自动视频字幕生成系统直接从原始视频数据映射到高层文本描述,绕过了定位和识别,从而丢弃了对于内容定位和泛化可能有价值的信息。在这项工作中,我们提出了一个自动视频字幕生成模型,该模型通过基于长短期记忆的深度神经网络结构,结合了时空注意力和图像分类。所得到的系统在标准的 YouTube 字幕生成基准测试中展示了最先进的结果,同时还在没有接地监督的情况下,提供了在空间和时间上定位视觉概念(主语、动词、宾语)的优势。

关键词

引用

@article{arxiv.1610.04997,
  title  = {Spatio-Temporal Attention Models for Grounded Video Captioning},
  author = {Mihai Zanfir and Elisabeta Marinoiu and Cristian Sminchisescu},
  journal= {arXiv preprint arXiv:1610.04997},
  year   = {2016}
}

备注

To appear in Asian Conference on Computer Vision (ACCV), Taipei, Taiwan, 2016