中文

面向两阶段自然语言视频定位的边界提议网络

计算机视觉与模式识别 2022-11-03 v2

摘要

我们旨在解决自然语言视频定位(NLVL)问题——在长而未裁剪的视频中定位与自然语言描述相对应的视频片段。最先进的 NLVL 方法几乎都是单阶段形式,通常可分为两类:1)基于锚点的方法:先预定义一系列视频片段候选(如通过滑动窗口),然后对每个候选进行分类;2)无锚点的方法:直接预测每个视频帧作为正片段内边界或中间帧的概率。然而,两类单阶段方法均有固有缺陷:基于锚点的方法易受启发式规则影响,进一步限制处理变长视频的能力;而无锚点的方法未能利用片段级交互,因而结果较差。本文提出一种新颖的边界提议网络(BPNet),这是一种通用的两阶段框架,摆脱了上述 issues。具体而言,第一阶段中,BPNet 利用无锚点模型生成一组具有边界的高质量候选视频片段。第二阶段提出视觉-语言融合层联合建模候选与语言查询间的多模态交互,随后由匹配分数评级层输出每个候选的对齐分数。我们在三个具挑战性的 NLVL 基准(即 Charades-STA、TACoS 和 ActivityNet-Captions)上评估 BPNet。在这些数据集上的大量实验与消融研究证明 BPNet 优于最先进方法。

关键词

引用

@article{arxiv.2103.08109,
  title  = {Boundary Proposal Network for Two-Stage Natural Language Video Localization},
  author = {Shaoning Xiao and Long Chen and Songyang Zhang and Wei Ji and Jian Shao and Lu Ye and Jun Xiao},
  journal= {arXiv preprint arXiv:2103.08109},
  year   = {2022}
}

备注

AAAI 2021