基于可学习时刻候选的自然语言视频定位
计算机视觉与模式识别
2022-11-02 v1
摘要
给定一段未裁剪视频和一条自然语言查询,自然语言视频定位(NLVL)旨在识别由该查询所描述的视频时刻。针对该任务,现有方法大致可分为两类:1)提议-排序模型先定义一组手工设计的时刻候选,再找出最佳匹配项;2)无提议模型直接从帧中预测所指时刻的两个时间边界。目前,几乎所有提议-排序方法的性能都劣于无提议方法。本文认为,提议-排序方法因预定义方式而被低估:1)手工设计规则难以保证对目标片段的完全覆盖;2)密集采样的候选时刻带来冗余计算并降低排序过程性能。为此,我们提出一种称为LPNet(用于NLVL的可学习提议网络)的新模型,其具有一组固定数量的可学习时刻提议。这些提议的位置和长度在训练过程中动态调整。此外,我们提出一种边界感知损失以利用帧级信息并进一步提升性能。在两个具有挑战性的NLVL基准上的大量消融实验证明了LPNet相对于现有最先进方法的有效性。
引用
@article{arxiv.2109.10678,
title = {Natural Language Video Localization with Learnable Moment Proposals},
author = {Shaoning Xiao and Long Chen and Jian Shao and Yueting Zhuang and Jun Xiao},
journal= {arXiv preprint arXiv:2109.10678},
year = {2022}
}
备注
emnlp21. arXiv admin note: text overlap with arXiv:2103.08109