中文

用于时序视频定位的位置感知定位回归网络

计算机视觉与模式识别 2022-04-13 v1

摘要

视频监控中成功定位的关键在于理解对应于重要参与者和物体的语义短语。传统方法忽略短语的综合上下文,或需要大量计算来处理多个短语。为了仅用一个语义短语理解综合上下文,我们提出位置感知定位回归网络(PLRN),其利用查询与视频的位置感知特征。具体而言,PLRN 首先利用词和视频片段的位置信息对视频和查询进行编码。然后,通过注意力从编码后的查询中提取语义短语特征。将语义短语特征与编码后的视频融合,并通过反映局部与全局上下文生成上下文感知特征。最后,PLRN 预测定位边界的起始、结束、中心和宽度值。我们的实验表明,PLRN 以更短的计算时间和内存取得了优于现有方法的竞争性性能。

关键词

引用

@article{arxiv.2204.05499,
  title  = {Position-aware Location Regression Network for Temporal Video Grounding},
  author = {Sunoh Kim and Kimin Yun and Jin Young Choi},
  journal= {arXiv preprint arXiv:2204.05499},
  year   = {2022}
}

备注

Accepted in AVSS 2021