略读、定位然后细读:一种类人的自然语言视频定位框架
计算机视觉与模式识别
2022-07-28 v1
摘要
本文研究自然语言视频定位(NLVL)问题。几乎所有现有工作都遵循“仅看一次”的框架,即利用单一模型直接捕捉视频-查询对之间复杂的跨模态与自模态关系并检索相关片段。然而,我们认为这些方法忽略了理想定位方法的两个不可或缺的特性:1) 帧可区分:考虑到正/负视频帧的不平衡,在定位过程中突出正帧并削弱负帧是有效的。2) 边界精确:为预测准确的片段边界,模型应捕捉连续帧之间更细粒度的差异,因为它们的变化通常是平滑的。为此,受人类感知和定位片段方式的启发,我们提出了一种称为略读-定位-细读(SLP)的两步类人框架。SLP 由略读与定位(SL)模块和双向细读(BP)模块组成。SL 模块首先参考查询语义从视频中选择最佳匹配帧,同时过滤掉不相关帧。然后,BP 模块基于该帧构建初始片段,并通过探索其相邻帧动态更新,直到没有帧共享相同的活动语义。在三个具有挑战性的基准上的实验结果表明,我们的 SLP 优于 SOTA 方法,并定位出更精确的片段边界。
引用
@article{arxiv.2207.13450,
title = {Skimming, Locating, then Perusing: A Human-Like Framework for Natural Language Video Localization},
author = {Daizong Liu and Wei Hu},
journal= {arXiv preprint arXiv:2207.13450},
year = {2022}
}
备注
Accepted by ACM MM 2022