前进并讲述:一种视频描述渐进式生成器
计算机视觉与模式识别
2018-07-27 v1
摘要
我们提出一个高效的框架,能够生成连贯的段落来描述给定视频。先前关于视频字幕的工作通常聚焦于视频片段。它们典型地将整个视频视为整体并基于单一嵌入生成字幕。相反,我们考虑具有丰富时间结构的视频,旨在生成能够保持故事流同时连贯且简洁的段落描述。为实现此目标,我们提出一种新方法,通过组装时间局部化的描述来产生描述性段落。给定视频,它选择一系列 distinctive 片段并以其上生成句子,方式连贯。特别地,片段的选择和句子的生成是联合且渐进式地由循环网络驱动的——下一步描述什么取决于之前已说了什么。此处,循环网络通过具有句子级和段落级奖励的自批判序列训练来学习。在ActivityNet Captions数据集上,我们的方法展示了为视频生成高质量段落描述的能力。与其他方法生成的相比,我们的方法产生的描述通常更相关、更连贯且更简洁。
引用
@article{arxiv.1807.10018,
title = {Move Forward and Tell: A Progressive Generator of Video Descriptions},
author = {Yilei Xiong and Bo Dai and Dahua Lin},
journal= {arXiv preprint arXiv:1807.10018},
year = {2018}
}
备注
Accepted by ECCV 2018