中文

基于门控融合网络与词性序列引导的可控视频描述生成

计算机视觉与模式识别 2019-08-28 v1

摘要

本文提出利用词性(POS)信息引导视频描述生成,该方法基于输入视频多种表示的门控融合。我们构建了一种新颖的门控融合网络,其中特别设计了一个交叉门控(CG)模块,以有效编码并融合不同类型的表示,例如输入视频的运动与内容特征。一个 POS 序列生成器依赖该融合表示预测全局句法结构,随后被用于引导视频描述生成并控制所生成句子的句法。具体而言,提出一种门控策略,将全局句法 POS 信息动态且自适应地融入解码器以生成每个词。在两个基准数据集 MSR-VTT 与 MSVD 上的实验结果表明,所提模型能很好地利用多表示的互补信息,从而获得性能提升。此外,生成的全局 POS 信息能较好捕捉句子的全局句法结构,因而可用于控制描述的句法结构。此类 POS 信息不仅提升了视频描述性能,也改善了生成描述的多样性。我们的代码见:https://github.com/vsislab/Controllable_XGating。

关键词

引用

@article{arxiv.1908.10072,
  title  = {Controllable Video Captioning with POS Sequence Guidance Based on Gated Fusion Network},
  author = {Bairui Wang and Lin Ma and Wei Zhang and Wenhao Jiang and Jingwen Wang and Wei Liu},
  journal= {arXiv preprint arXiv:1908.10072},
  year   = {2019}
}

备注

Accepted by ICCV 2019