用户生成视频的标题生成
计算机视觉与模式识别
2016-09-09 v2 人工智能
多媒体
摘要
一个好的视频标题能简洁地描述最显著的事件并吸引观众的注意力。相比之下,视频字幕往往生成描述整个视频的句子。尽管自动生成视频标题是一项非常有用的任务,但它远不如视频字幕那样受到关注。我们首次通过提出两种将最先进的视频字幕模型扩展到此新任务的方法来应对视频标题生成。首先,我们通过用高光检测器引导视频字幕模型,使其对高光敏感。我们的框架允许联合训练标题生成和视频高光定位模型。其次,我们在视频字幕模型中引入高句子多样性,使得生成的标题也具有多样性和吸引力。这意味着可能需要大量句子来学习标题的句子结构。因此,我们提出了一种新颖的句子增强方法,用额外的仅包含句子而没有对应视频的样本来训练字幕模型。我们收集了一个大规模的自然场景视频标题(VTW)数据集,包含 18100 个自动抓取的用户生成视频和标题。在 VTW 上,我们的方法持续提高了标题预测准确率,并在自动评估和人工评估中均取得了最佳性能。最后,我们的句子增强方法在 M-VAD 数据集上也优于基线方法。
引用
@article{arxiv.1608.07068,
title = {Title Generation for User Generated Videos},
author = {Kuo-Hao Zeng and Tseng-Hung Chen and Juan Carlos Niebles and Min Sun},
journal= {arXiv preprint arXiv:1608.07068},
year = {2016}
}
备注
14 pages, 4 figures, ECCV2016