中文

用于文本到视频片段检索的多层级语言与视觉融合

计算机视觉与模式识别 2018-12-27 v3

摘要

我们探讨了视频中基于文本的活动检索问题。给定一个描述活动的句子,我们的任务是从未剪辑视频中检索匹配的片段。为了捕捉文本和视频中固有的结构,我们引入了一个多层级模型,该模型比先前工作更早且更紧密地融合了视觉和语言特征。首先,我们在生成视频片段提议时及早注入文本特征,以帮助排除不太可能的片段,从而加快处理速度并提升性能。其次,为了学习用于检索的细粒度相似性度量,我们在循环神经网络中使用视觉特征在词级别调制查询句子的处理过程。此外,通过将查询重生成作为辅助任务,我们采用了多任务损失。我们的方法在两个具有挑战性的基准测试 Charades-STA 和 ActivityNet Captions 上显著优于先前的工作。

关键词

引用

@article{arxiv.1804.05113,
  title  = {Multilevel Language and Vision Integration for Text-to-Clip Retrieval},
  author = {Huijuan Xu and Kun He and Bryan A. Plummer and Leonid Sigal and Stan Sclaroff and Kate Saenko},
  journal= {arXiv preprint arXiv:1804.05113},
  year   = {2018}
}

备注

AAAI 2019