PcmNet:用于时序动作定位的位置敏感上下文建模网络
计算机视觉与模式识别
2021-03-10 v1
摘要
时序动作定位是一项重要且具有挑战性的任务,旨在定位真实世界未裁剪视频中动作发生的时间区域并识别其类别。学界普遍认为视频上下文是视频理解的关键线索,利用上下文已成为提升定位性能的重要策略。然而,以往最先进的方法更多关注探索捕捉帧间或候选框间特征相似性的语义上下文,而忽视了对于时序定位至关重要的位置上下文。本文提出一种时间位置敏感上下文建模方法,将位置信息与语义信息相结合以实现更精确的动作定位。具体而言,我们首先利用有向时间位置编码增强特征表示,随后在帧级和候选框级进行基于注意力的信息传播。由此生成的特征表示显著增强了编码位置感知上下文信息的判别能力,从而有利于边界检测与候选框评估。我们在 THUMOS-14 和 ActivityNet-1.3 两个具有挑战性的数据集上均取得了最先进的性能,证明了方法的有效性与泛化能力。
引用
@article{arxiv.2103.05270,
title = {PcmNet: Position-Sensitive Context Modeling Network for Temporal Action Localization},
author = {Xin Qin and Hanbin Zhao and Guangchen Lin and Hao Zeng and Songcen Xu and Xi Li},
journal= {arXiv preprint arXiv:2103.05270},
year = {2021}
}