基于文本的视频语料库中时刻定位
计算机视觉与模式识别
2021-11-10 v2
摘要
先前基于文本的视频时刻定位工作集中于在未剪辑视频中按时间 grounding 文本查询。这些工作假设相关视频已知,并仅尝试在该相关视频上定位时刻。与此类工作不同,我们放宽该假设,并解决给定句子查询下在视频语料库中定位时刻的任务。该任务带来独特挑战,因为系统需要执行:(i)相关视频的检索,其中仅视频的一段与查询句子对应;(ii)基于句子查询在相关视频中按时间定位时刻。为克服此挑战,我们提出层次化时刻对齐网络(HMAN),其学习时刻与句子的有效联合嵌入空间。除学习视频内时刻间的细微差异外,HMAN 还侧重于基于句子查询区分视频间的全局语义概念。在三个基准基于文本的视频时刻检索数据集——Charades-STA、DiDeMo 和 ActivityNet Captions——上的定性与定量结果表明,我们的方法在所提出的视频语料库中时刻时间定位任务上取得了有前景的性能。
引用
@article{arxiv.2008.08716,
title = {Text-based Localization of Moments in a Video Corpus},
author = {Sudipta Paul and Niluthpol Chowdhury Mithun and Amit K. Roy-Chowdhury},
journal= {arXiv preprint arXiv:2008.08716},
year = {2021}
}