中文

丰富局部与全局上下文以用于时序动作定位

计算机视觉与模式识别 2021-08-10 v2

摘要

有效解决时序动作定位(TAL)问题需要一种联合追求两个相互冲突目标的视觉表示,即用于时序定位的细粒度判别性和用于动作分类的充足视觉不变性。我们通过丰富流行的两阶段时序定位框架中的局部和全局上下文来应对这一挑战,该框架首先生成动作提议,随后进行动作分类和时序边界回归。我们提出的模型称为ContextLoc,可分为三个子网络:L-Net、G-Net和P-Net。L-Net通过片段级特征的细粒度建模丰富局部上下文,其被表述为一个查询与检索过程。G-Net通过视频级表示的更高层建模丰富全局上下文。此外,我们引入了一种新颖的上下文自适应模块,以使全局上下文适应不同的提议。P-Net进一步建模上下文感知的提议间关系。我们在实验中探索了两种现有模型作为P-Net。我们提出方法的效能通过THUMOS14([email protected]下54.3%)和ActivityNet v1.3([email protected]下56.01%)数据集上的实验结果得到验证,其优于近期最先进水平。代码可在https://github.com/buxiangzhiren/ContextLoc获取。

关键词

引用

@article{arxiv.2107.12960,
  title  = {Enriching Local and Global Contexts for Temporal Action Localization},
  author = {Zixin Zhu and Wei Tang and Le Wang and Nanning Zheng and Gang Hua},
  journal= {arXiv preprint arXiv:2107.12960},
  year   = {2021}
}

备注

Accepted by ICCV 2021