中文

面向零样本视频检索的双编码方法

计算机视觉与模式识别 2019-03-20 v3

摘要

本文攻克零样本视频检索这一极具挑战性的问题。在此检索范式下,终端用户通过自然语言文本描述的临时查询来搜索未标注视频,且不提供视觉示例。给定作为帧序列的视频和作为词序列的查询,需要有效的序列到序列跨模态匹配。现有多数方法基于概念,从查询和视频中提取相关概念并据此建立两模态间的关联。相比之下,本文采取无概念方法,提出一种双深度编码网络,将视频和查询各自编码为强大的稠密表示。双编码在概念上简单、实践中有效且端到端。如在MSR-VTT、TRECVID 2016与2017 Ad-hoc Video Search三个基准上的实验所示,所提方案确立了零样本视频检索的新state-of-the-art。

关键词

引用

@article{arxiv.1809.06181,
  title  = {Dual Encoding for Zero-Example Video Retrieval},
  author = {Jianfeng Dong and Xirong Li and Chaoxi Xu and Shouling Ji and Yuan He and Gang Yang and Xun Wang},
  journal= {arXiv preprint arXiv:1809.06181},
  year   = {2019}
}

备注

Accepted by CVPR 2019. Code and data are available at https://github.com/danieljf24/dual_encoding