用于视频中时序语句定位的自适应提案生成网络
计算机视觉与模式识别
2021-09-15 v1 计算与语言
摘要
我们解决视频中时序语句定位(TSLV)问题。传统方法遵循自顶向下框架,利用预定义片段提案定位目标片段。尽管它们取得了不错性能,但提案是手工设计且冗余的。近来,自底向上框架因其更优效率而受到越来越多关注,它直接预测每帧作为边界的概率。然而,自底向上模型的性能不及自顶向下对应模型,因其未能利用片段级交互。本文提出一种自适应提案生成网络(APGN),在保持片段级交互的同时提升效率。具体而言,我们首先对视频进行前景-背景分类,并对前景帧回归以自适应生成提案。由此摒弃了手工提案设计并减少了冗余提案。进而,我们进一步开发提案整合模块以增强所生成提案的语义。最后,我们遵循自顶向下框架利用这些生成的提案定位目标时刻。在三个具挑战性基准上的大量实验表明,我们所提 APGN 显著优于以往 SOTA 方法。
引用
@article{arxiv.2109.06398,
title = {Adaptive Proposal Generation Network for Temporal Sentence Localization in Videos},
author = {Daizong Liu and Xiaoye Qu and Jianfeng Dong and Pan Zhou},
journal= {arXiv preprint arXiv:2109.06398},
year = {2021}
}
备注
Accepted as a long paper in the main conference of EMNLP 2021