中文

基于上下文边界感知预测的视频语言查询时间定位

计算机视觉与模式识别 2019-12-19 v2

摘要

视频中语言查询的时间定位任务是 temporally localize 与给定语言(句子)最匹配的视频片段。它需要特定模型同时执行视觉与语言理解。先前工作主要忽略片段定位的精度。基于滑动窗口的方法使用预定义搜索窗口尺寸,存在冗余计算,而现有基于锚点的方法无法产生精确定位。我们通过提出一种端到端边界感知模型解决此问题,其使用轻量分支预测对应于给定语言信息的语义边界。为更好检测语义边界,我们提出通过显式建模当前元素与其邻域关系来聚合上下文信息。随后在测试阶段基于锚点与边界预测选择最具置信的片段。所提模型称为上下文边界感知预测(Contextual Boundary-aware Prediction, CBP),在三个公开数据集上以明显优势超越竞争方法。所有代码见 https://github.com/JaywongWang/CBP 。

关键词

引用

@article{arxiv.1909.05010,
  title  = {Temporally Grounding Language Queries in Videos by Contextual Boundary-aware Prediction},
  author = {Jingwen Wang and Lin Ma and Wenhao Jiang},
  journal= {arXiv preprint arXiv:1909.05010},
  year   = {2019}
}

备注

Accepted to AAAI 2020