基于上下文边界感知预测的视频语言查询时间定位
计算机视觉与模式识别
2019-12-19 v2
摘要
视频中语言查询的时间定位任务是 temporally localize 与给定语言(句子)最匹配的视频片段。它需要特定模型同时执行视觉与语言理解。先前工作主要忽略片段定位的精度。基于滑动窗口的方法使用预定义搜索窗口尺寸,存在冗余计算,而现有基于锚点的方法无法产生精确定位。我们通过提出一种端到端边界感知模型解决此问题,其使用轻量分支预测对应于给定语言信息的语义边界。为更好检测语义边界,我们提出通过显式建模当前元素与其邻域关系来聚合上下文信息。随后在测试阶段基于锚点与边界预测选择最具置信的片段。所提模型称为上下文边界感知预测(Contextual Boundary-aware Prediction, CBP),在三个公开数据集上以明显优势超越竞争方法。所有代码见 https://github.com/JaywongWang/CBP 。
引用
@article{arxiv.1909.05010,
title = {Temporally Grounding Language Queries in Videos by Contextual Boundary-aware Prediction},
author = {Jingwen Wang and Lin Ma and Wenhao Jiang},
journal= {arXiv preprint arXiv:1909.05010},
year = {2019}
}
备注
Accepted to AAAI 2020