基于示例句子的可控视频描述生成
计算机视觉与模式识别
2021-12-03 v1 计算与语言
摘要
本文研究一项新颖且具挑战性的任务,即基于示例句子的可控视频描述生成。形式上,给定一段视频和一个句法有效的示例句子,该任务旨在生成一则既描述视频语义内容、又遵循所给示例句子句法形式的描述。为应对这一基于示例的视频描述任务,我们提出一种新颖的句法调制描述生成器(SMCG),其嵌入于编码器-解码器-重建器架构中。所提 SMCG 以视频语义表示为输入,并依据给定示例句子的编码句法信息,对长短期记忆网络的门与单元进行条件调制。因此,SMCG 能够控制词预测的状态并实现句法定制的描述生成。我们通过为两个公开视频描述数据集收集辅助示例句子开展实验。大量实验结果证明了我们的方法在生成句法可控且语义保留的视频描述上的有效性。通过提供不同示例句子,我们的方法能够产出具有不同句法结构的多种描述,从而指明加强视频描述多样性的可行途径。
引用
@article{arxiv.2112.01073,
title = {Controllable Video Captioning with an Exemplar Sentence},
author = {Yitian Yuan and Lin Ma and Jingwen Wang and Wenwu Zhu},
journal= {arXiv preprint arXiv:2112.01073},
year = {2021}
}