基于对比学习的视频语料库时刻检索
计算与语言
2021-05-14 v1 计算机视觉与模式识别
信息检索
摘要
给定一组未裁剪且未分割的视频,视频语料库时刻检索(VCMR)旨在检索与给定文本查询在语义上对应的时间时刻(即视频的一段)。由于视频和文本来自两个不同的特征空间,解决 VCMR 有两类通用方法:(i)分别编码每种模态的表示,然后对齐两种模态表示以进行查询处理;(ii)采用细粒度跨模态交互来学习多模态表示以进行查询处理。虽然第二种方法通常带来更好的检索精度,但第一种方法效率更高。本文中,我们提出一种带对比学习的检索与定位网络(ReLoCLNet)用于 VCMR。我们采用第一种方法,并引入两个对比学习目标来精炼视频编码器和文本编码器,以分别学习视频和文本表示,但为 VCMR 实现更好的对齐。视频对比学习(VideoCL)旨在视频级别最大化查询与候选视频之间的互信息。帧对比学习(FrameCL)旨在视频内于帧级别高亮与查询对应的时刻区域。实验结果表明,尽管 ReLoCLNet 为效率而分别编码文本和视频,其检索精度与采用跨模态交互学习的基线相当。
引用
@article{arxiv.2105.06247,
title = {Video Corpus Moment Retrieval with Contrastive Learning},
author = {Hao Zhang and Aixin Sun and Wei Jing and Guoshun Nan and Liangli Zhen and Joey Tianyi Zhou and Rick Siow Mong Goh},
journal= {arXiv preprint arXiv:2105.06247},
year = {2021}
}
备注
11 pages, 7 figures and 6 tables. Accepted by SIGIR 2021