基于文本查询的弱监督视频时刻检索
计算机视觉与模式识别
2019-09-06 v2 多媒体
摘要
近期已有若干利用自然语言查询进行文本到视频时刻检索的方法被提出,但其训练需要完全监督。然而,获取大量带有各文本描述时间边界标注的训练视频极其耗时且往往难以扩展。为应对此问题,本文中我们引入了从弱标签学习以完成文本到视频时刻检索任务的问题。监督的弱性在于:训练时我们仅能获取视频-文本对,而非不同文本描述所对应的视频时间区间。我们提出了一种基于联合视觉-语义嵌入的框架,仅使用视频级句子描述来学习视频中相关片段的概念。具体而言,我们的核心思想是利用文本引导注意力(TGA)实现视频帧与句子描述间的潜在对齐。TGA 随后在测试阶段被用于检索相关时刻。在两个基准数据集上的实验表明,我们的方法取得了与最先进全监督方法相当的性能。
引用
@article{arxiv.1904.03282,
title = {Weakly Supervised Video Moment Retrieval From Text Queries},
author = {Niluthpol Chowdhury Mithun and Sujoy Paul and Amit K. Roy-Chowdhury},
journal= {arXiv preprint arXiv:1904.03282},
year = {2019}
}
备注
Revised Table 1 in Page 6, A small bug related to rounding resulted in a slightly improved score in the previous version. Our conclusion remains the same after the update