基于主题引导的视频描述生成
计算机视觉与模式识别
2017-09-05 v2 计算与语言
摘要
用自然语言生成视频描述(即视频字幕)是一项比图像字幕更具挑战性的任务,因为视频在两个方面本质上比图像更复杂。首先,视频涵盖更广泛的主题,如新闻、音乐、体育等。其次,同一视频中可能共存多个主题。在本文中,我们提出了一种新颖的字幕模型,即主题引导模型(TGM),通过利用主题信息为开放域视频生成面向主题的描述。除了预定义主题(即从网络抓取的类别标签)外,我们还通过无监督主题挖掘模型,基于训练字幕以数据驱动的方式挖掘主题。我们表明,数据驱动的主题比预定义主题反映了更好的主题模式。对于测试视频的主题预测,我们将主题挖掘模型视为教师,通过利用视频中的完整多模态信息(尤其是语音模态)来训练学生模型,即主题预测模型。我们提出了一系列字幕模型来利用主题引导,包括隐式地将主题作为输入特征以生成与主题相关的词语,以及显式地用主题修改解码器中的权重,使其充当主题感知语言解码器的集成。我们在当前最大的视频字幕数据集 MSR-VTT 上的综合实验结果证明了我们主题引导模型的有效性,该模型显著超越了 2016 年 MSR 视频到语言挑战赛中的获胜性能。
引用
@article{arxiv.1708.09666,
title = {Generating Video Descriptions with Topic Guidance},
author = {Shizhe Chen and Jia Chen and Qin Jin},
journal= {arXiv preprint arXiv:1708.09666},
year = {2017}
}
备注
Appeared at ICMR 2017