中文

用于语言描述视频时刻定位的渐进式定位网络

计算机视觉与模式识别 2022-03-04 v2

摘要

本文针对语言描述视频时刻定位任务。该任务的语言描述设定允许目标活动为开放集合,导致视频时刻的时间长度差异很大。大多数现有方法倾向于先以各种时间长度充分采样候选时刻,再将其与给定查询进行匹配以确定目标时刻。然而,以固定时间粒度生成的候选时刻在处理时刻长度的大幅变化方面可能是次优的。为此,我们提出了一种新颖的多阶段渐进式定位网络(PLN),以由粗到精的方式渐进定位目标时刻。具体而言,PLN 的每个阶段都有一个定位分支,并聚焦于以特定时间粒度生成的候选时刻。各阶段候选时刻的时间粒度不同。此外,我们设计了一个条件特征操控模块和上采样连接来桥接多个定位分支。以此方式,后续阶段能够吸收先前学习的信息,从而促进更细粒度的定位。在三个公开数据集上的大量实验证明了我们提出的 PLN 在语言描述视频时刻定位上的有效性,尤其是在长视频中定位短时刻方面。

关键词

引用

@article{arxiv.2102.01282,
  title  = {Progressive Localization Networks for Language-based Moment Localization},
  author = {Qi Zheng and Jianfeng Dong and Xiaoye Qu and Xun Yang and Yabing Wang and Pan Zhou and Baolong Liu and Xun Wang},
  journal= {arXiv preprint arXiv:2102.01282},
  year   = {2022}
}

备注

submited to TOMM