中文

基于潜变量扩展的多样化视频描述生成

计算机视觉与模式识别 2021-06-16 v6 机器学习

摘要

用文本描述自动描述视频内容是一项具有挑战性但重要的任务,在计算机视觉领域吸引了大量关注。以往工作主要追求生成句子的准确性,而忽略了句子多样性,这与人类行为不一致。本文旨在为每段视频生成多种描述,并提出一种新颖框架。具体而言,对于给定的视频,将常规编码-解码过程的中间潜变量作为条件生成对抗网络(CGAN)的输入,以生成多样化句子。我们采用不同的卷积神经网络(CNN)作为生成器,基于潜变量生成描述,并作为判别器评估生成句子的质量。同时,设计了一种新的 DCE 指标来评估多样化描述。我们在基准数据集上评估了该方法,结果表明其能够生成多样化描述,并优于其他最先进的方法。

关键词

引用

@article{arxiv.1910.12019,
  title  = {Diverse Video Captioning Through Latent Variable Expansion},
  author = {Huanhou Xiao and Jinglun Shi},
  journal= {arXiv preprint arXiv:1910.12019},
  year   = {2021}
}