基于潜变量扩展的多样化视频描述生成
计算机视觉与模式识别
2021-06-16 v6 机器学习
摘要
用文本描述自动描述视频内容是一项具有挑战性但重要的任务,在计算机视觉领域吸引了大量关注。以往工作主要追求生成句子的准确性,而忽略了句子多样性,这与人类行为不一致。本文旨在为每段视频生成多种描述,并提出一种新颖框架。具体而言,对于给定的视频,将常规编码-解码过程的中间潜变量作为条件生成对抗网络(CGAN)的输入,以生成多样化句子。我们采用不同的卷积神经网络(CNN)作为生成器,基于潜变量生成描述,并作为判别器评估生成句子的质量。同时,设计了一种新的 DCE 指标来评估多样化描述。我们在基准数据集上评估了该方法,结果表明其能够生成多样化描述,并优于其他最先进的方法。
引用
@article{arxiv.1910.12019,
title = {Diverse Video Captioning Through Latent Variable Expansion},
author = {Huanhou Xiao and Jinglun Shi},
journal= {arXiv preprint arXiv:1910.12019},
year = {2021}
}