基于检索-拷贝-生成网络的开放书式视频描述生成
计算机视觉与模式识别
2021-03-10 v1 计算与语言
摘要
由于短视频的迅速涌现以及对内容理解与创作的需求,视频描述生成任务近年来受到越来越多的关注。在本文中,我们将传统的视频描述生成任务转化为一种新的范式,即开放书式视频描述生成(Open-book Video Captioning),该范式在视频内容相关句子的提示下生成自然语言,而不局限于视频本身。为解决开放书式视频描述生成问题,我们提出了一种新颖的检索-拷贝-生成网络(Retrieve-Copy-Generate network),其中构建了一个可插拔的视频到文本检索器,用于从训练语料中有效检索句子作为提示,并引入了一个拷贝机制生成器,用于动态地从多检索句子中抽取表达。这两个模块可以端到端或分别训练,灵活且可扩展。我们的框架将传统的基于检索的方法与正统的编码器-解码器方法相协调,既能借鉴检索句子中的多样表达,又能生成自然且准确的视频内容。在多个基准数据集上的大量实验表明,我们提出的方法超越了最先进的性能,表明了所提范式在视频描述生成任务中的有效性与前景。
引用
@article{arxiv.2103.05284,
title = {Open-book Video Captioning with Retrieve-Copy-Generate Network},
author = {Ziqi Zhang and Zhongang Qi and Chunfeng Yuan and Ying Shan and Bing Li and Ying Deng and Weiming Hu},
journal= {arXiv preprint arXiv:2103.05284},
year = {2021}
}
备注
Accepted by CVPR 2021