中文

利用上下文文本丰富视频字幕

计算机视觉与模式识别 2020-07-30 v1 计算与语言

摘要

理解视频内容并生成带上下文的字幕是一项重要且具有挑战性的任务。与先前通常试图生成无上下文的通用视频字幕的方法不同,我们的架构通过融入从相关文本数据中提取的信息来实现上下文感知的字幕生成。我们提出了一种端到端的序列到序列模型,该模型基于视觉输入生成视频字幕,并从上下文文本中挖掘诸如名称和地点等相关知识。与以往方法不同,我们不对文本做进一步预处理,而是让模型直接学习对其施加注意力。在视觉输入的引导下,模型能够通过指针-生成器网络从上下文文本中复制词语,从而生成更具体的视频字幕。我们在新闻视频数据集上展示了具有竞争力的性能,并通过消融实验验证了上下文视频字幕生成以及我们模型架构中各项设计选择的有效性。

关键词

引用

@article{arxiv.2007.14682,
  title  = {Enriching Video Captions With Contextual Text},
  author = {Philipp Rimle and Pelin Dogan and Markus Gross},
  journal= {arXiv preprint arXiv:2007.14682},
  year   = {2020}
}

备注

Accepted at ICPR 2020