基于单帧标注的文本查询视频时刻检索
计算机视觉与模式识别
2022-06-22 v3
摘要
视频时刻检索旨在根据给定自然语言查询找出某时刻(视频的一部分)的起止时间戳。全监督方法需要完整的时间边界标注以取得理想结果,这代价高昂,因为标注者需观看整个时刻。弱监督方法仅依赖配对的视频与查询,但性能相对较差。本文仔细考察标注过程,提出一种称为“一瞥标注”的新范式。该范式仅需完全监督对应时间边界内单张随机帧的时间戳,我们称之为“一瞥”。我们认为这有益,因为相较于弱监督,仅增加微不足道的成本却提供了更大的性能潜力。在一瞥标注设定下,我们提出一种基于对比学习、名为基于一瞥标注的视频时刻检索(ViGA)的方法。ViGA 将输入视频切分为片段并与查询进行对比,其中由一瞥引导的高斯分布权重被分配给所有片段。我们充分的实验表明,ViGA 以较大优势优于 SOTA 弱监督方法,在某些情况下甚至可与全监督方法媲美。
引用
@article{arxiv.2204.09409,
title = {Video Moment Retrieval from Text Queries via Single Frame Annotation},
author = {Ran Cui and Tianwen Qian and Pai Peng and Elena Daskalaki and Jingjing Chen and Xiaowei Guo and Huyang Sun and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2204.09409},
year = {2022}
}
备注
Accepted as full paper in SIGIR 2022