中文

结合视频与蕴含生成的多任务视频字幕生成

计算与语言 2017-08-09 v2 人工智能 计算机视觉与模式识别

摘要

视频字幕生成,即描述视频内容的任务,近年来通过序列到序列模型取得了一些有前景的改进,但准确学习任务中涉及的时间和逻辑动态仍具挑战,尤其在缺乏充足标注数据的情况下。我们通过与两个相关的定向生成任务共享知识来改进视频字幕生成:时间定向的无监督视频预测任务,用于学习更丰富的上下文感知视频编码器表示;以及逻辑定向的语言蕴含生成任务,用于学习更好的视频蕴含字幕解码器表示。为此,我们提出了一种多对多多任务学习模型,在三个任务的编码器和解码器之间共享参数。我们在多个标准视频字幕生成数据集上利用多样的自动和人工评估取得了显著改进并达到新的最优性能。我们还展示了在蕴含生成任务上的相互多任务改进。

关键词

引用

@article{arxiv.1704.07489,
  title  = {Multi-Task Video Captioning with Video and Entailment Generation},
  author = {Ramakanth Pasunuru and Mohit Bansal},
  journal= {arXiv preprint arXiv:1704.07489},
  year   = {2017}
}

备注

ACL 2017 (14 pages w/ supplementary)