用于视频中基于查询的时刻检索的跨模态交互网络
信息检索
2019-07-30 v2 计算机视觉与模式识别
多媒体
摘要
基于查询的时刻检索旨在根据给定的自然语言查询在未剪辑视频中定位最相关的时刻。现有工作往往只关注这一新兴任务的某一方面,如查询表示学习、视频上下文建模或多模态融合,因而未能构建一个用于进一步提升性能的完备系统。本文引入一种新颖的跨模态交互网络(CMIN)来考虑这一挑战性任务的多个关键因素,包括(1)自然语言查询的句法结构;(2)视频上下文中的长程语义依赖;(3)充分的跨模态交互。具体而言,我们设计了一个句法GCN以利用查询的句法结构进行细粒度表示学习,提出多头自注意力以从视频上下文中捕获长程语义依赖,并随后采用多阶段跨模态交互来探索视频与查询内容之间的潜在关联。大量实验证明了我们所提方法的有效性。
引用
@article{arxiv.1906.02497,
title = {Cross-Modal Interaction Networks for Query-Based Moment Retrieval in Videos},
author = {Zhu Zhang and Zhijie Lin and Zhou Zhao and Zhenxin Xiao},
journal= {arXiv preprint arXiv:1906.02497},
year = {2019}
}
备注
Accepted by SIGIR 2019 as a full paper