语义引导的视频描述生成
计算机视觉与模式识别
2019-12-13 v1
摘要
当前的视频描述生成方法常存在未能描述待描述视频中物体,却生成与真实语句语义相似的句子的问题。本文提出一种新的视频描述生成方法,能够描述由目标检测检测到的物体,并生成与正确描述含义相近的句子。我们的模型基于 S2VT(一种用于视频描述生成的序列到序列模型)。给定视频帧序列,编码 RNN 将一帧及其中的检测物体一并输入,以融入场景中的物体信息。随后的解码 RNN 输出被送入注意力层,再送至解码器以生成描述。通过度量学习将生成描述与真实描述进行比较,使生成描述的向量表示在语义上与真实描述相似。在 MSDV 数据集上的实验结果表明,所提方法的性能明显优于未采用该语义引导框架的模型,证明了该方法的有效性。代码已公开于 https://github.com/captanlevi/Meaning-guided-video-captioning-。
引用
@article{arxiv.1912.05730,
title = {Meaning guided video captioning},
author = {Rushi J. Babariya and Toru Tamaki},
journal= {arXiv preprint arXiv:1912.05730},
year = {2019}
}
备注
The 5th Asian Conference on Pattern Recognition (ACPR 2019)