中文

从字幕到叙事:多句子视频字幕生成

计算机视觉与模式识别 2016-05-19 v1

摘要

近期图像字幕任务的进展引发了视频字幕任务日益增长的兴趣。然而,多数视频字幕工作聚焦于生成聚合特征的单一输入,这几乎未偏离图像字幕过程,且未充分利用视频中存在的动态内容。我们尝试通过时间分割视频与动作定位,从多帧生成多个字幕,并利用自然语言处理技术将其连接,以生成故事般的字幕,从而生成内容更丰富的视频字幕。我们展示了所提方法能够生成内容更丰富的字幕,且无需显式使用视频级特征作为输入即可与最先进(state-of-the-art)方法竞争。

关键词

引用

@article{arxiv.1605.05440,
  title  = {Beyond Caption To Narrative: Video Captioning With Multiple Sentences},
  author = {Andrew Shin and Katsunori Ohnishi and Tatsuya Harada},
  journal= {arXiv preprint arXiv:1605.05440},
  year   = {2016}
}

备注

accepted to ICIP 2016