视频中时序语句定位研究综述
计算机视觉与模式识别
2021-09-20 v2 人工智能
多媒体
摘要
视频中时序语句定位(TSGV)旨在根据给定语句查询从未剪辑视频中定位出一个目标片段,近年来在研究界引起了越来越多的关注。与时序动作定位任务不同,TSGV更为灵活,因为它可以通过自然语言定位复杂活动,而不受预定义动作类别的限制。同时,TSGV更具挑战性,因为它需要文本和视觉两方面的理解以实现两种模态(即文本和视频)之间的语义对齐。在本综述中,我们对TSGV进行了全面概述,其i)总结了现有方法的分类体系,ii)提供了TSGV中所用评估协议(即数据集与指标)的详细描述,以及iii)深入探讨了当前基准设计中的潜在问题及进一步研究的方向。据我们所知,这是首个关于时序语句定位的系统性综述。更具体地,我们首先将现有TSGV方法分为四类进行讨论,即两阶段方法、端到端方法、基于强化学习的方法以及弱监督方法。然后我们介绍了用于评估当前研究进展的基准数据集与评价指标。最后,我们通过指出当前评估协议中未妥善解决的潜在问题来讨论TSGV中的一些局限性,这可能会推动TSGV中更多前沿研究。此外,我们还分享了关于若干有前景方向的见解,包括基于TSGV的三种具有新颖且实用设置的典型任务。
引用
@article{arxiv.2109.08039,
title = {A Survey on Temporal Sentence Grounding in Videos},
author = {Xiaohan Lan and Yitian Yuan and Xin Wang and Zhi Wang and Wenwu Zhu},
journal= {arXiv preprint arXiv:2109.08039},
year = {2021}
}
备注
32 pages with 19 figures