为时间动作定位建模多标签动作依赖关系
计算机视觉与模式识别
2021-06-01 v3
摘要
真实世界视频包含许多具有类间内在关系的复杂动作。本文提出一种基于注意力的架构,为未修剪视频中的时间动作定位任务建模这些动作关系。与以往利用动作视频级共现的工作不同,我们区分了同时发生动作间的关系与不同时刻发生动作间(即先后发生)的关系。我们将这些不同关系定义为动作依赖。我们提出通过在新颖的基于注意力的多标签动作依赖(MLAD)层中建模这些动作依赖来提升动作定位性能。MLAD层由两支构成:共现依赖分支与时序依赖分支,分别建模共现动作依赖与时序动作依赖。我们观察到现有用于多标签分类的度量未显式衡量动作依赖建模的优劣,因此提出考虑动作类间共现与时序依赖的新颖度量。通过实证评估与广泛分析,我们在多标签动作定位基准(MultiTHUMOS与Charades)上以f-mAP及所提度量显示了相较最先进方法的性能提升。
引用
@article{arxiv.2103.03027,
title = {Modeling Multi-Label Action Dependencies for Temporal Action Localization},
author = {Praveen Tirupattur and Kevin Duarte and Yogesh Rawat and Mubarak Shah},
journal= {arXiv preprint arXiv:2103.03027},
year = {2021}
}