用于时序动作定位的图卷积网络
计算机视觉与模式识别
2019-09-10 v1
摘要
大多数最先进的动作定位系统逐个处理每个动作提议,在学习过程中未显式利用它们之间的关系。然而,提议之间的关系实际上在动作定位中起着重要作用,因为一个有意义的动作总是由视频中的多个提议组成。本文中,我们提出利用图卷积网络(GCNs)来挖掘提议-提议关系。首先,我们构建动作提议图,其中每个提议表示为一个节点,两个提议之间的关系表示为一条边。此处我们使用两类关系,一类用于捕获每个提议的上下文信息,另一类用于刻画不同动作之间的相关性。然后我们在该图上应用 GCNs 以建模不同提议间的关系,并为动作分类与定位学习强有力的表示。实验结果表明,我们的方法在 THUMOS14 上显著优于最先进水平(49.1% 对比 42.8%)。此外,在 ActivityNet 上的增强实验也验证了建模动作提议关系的有效性。代码见 https://github.com/Alvin-Zeng/PGCN。
引用
@article{arxiv.1909.03252,
title = {Graph Convolutional Networks for Temporal Action Localization},
author = {Runhao Zeng and Wenbing Huang and Mingkui Tan and Yu Rong and Peilin Zhao and Junzhou Huang and Chuang Gan},
journal= {arXiv preprint arXiv:1909.03252},
year = {2019}
}
备注
ICCV 2019