中文

接地视频描述

计算机视觉与模式识别 2019-05-07 v2

摘要

视频描述是视觉与语言理解中最具挑战性的问题之一,因为视频与语言两侧均存在巨大变异性。因此,模型通常会捷径绕过识别中的困难,生成基于先验但未必接地于视频的似是而非的句子。在本工作中,我们通过将句子中的每个名词短语标注为视频某一帧中对应的边界框,显式地将句子与视频中的证据相链接。我们的数据集ActivityNet-Entities在具有挑战性的ActivityNet Captions数据集上增补了158k个边界框标注,每个标注接地一个名词短语。这允许用此数据训练视频描述模型,并且重要的是,可评估此类模型对其所描述视频的接地程度或“真实性”。为生成接地描述,我们提出了一种能够利用这些边界框标注的新型视频描述模型。我们在我们的数据集上展示了模型的有效性,同时也展示其如何应用于Flickr30k Entities数据集上的图像描述。我们在视频描述、视频段落描述及图像描述上取得了SOTA性能,并证明我们所生成的句子更好地接地于视频。

关键词

引用

@article{arxiv.1812.06587,
  title  = {Grounded Video Description},
  author = {Luowei Zhou and Yannis Kalantidis and Xinlei Chen and Jason J. Corso and Marcus Rohrbach},
  journal= {arXiv preprint arXiv:1812.06587},
  year   = {2019}
}

备注

CVPR 2019 oral, camera-ready version including appendix