中文

用于动作分割的堆叠时空图卷积网络

计算机视觉与模式识别 2019-06-04 v6

摘要

我们提出新颖的堆叠时空图卷积网络(Stacked-STGCN)用于动作分割,即在长视频上预测并定位一系列动作。我们将最初为基于骨架的动作识别提出的时空图卷积网络(STGCN)进行扩展,以支持具有不同特征(例如场景、演员、物体、动作等)的节点、长度可变的特征描述子以及任意的时间边连接,以应对通常与复杂活动相关的大图形变。我们进一步将堆叠沙漏架构引入STGCN,以利用编码器-解码器设计的优势来提升泛化性能和定位精度。我们探索了各种描述子,如帧级VGG、段级I3D、基于RCNN的物体等作为节点描述子,以基于综合上下文信息的联合推断实现动作分割。我们在CAD120(其提供预计算节点特征和边权以进行算法间公平性能比较)以及更复杂的真实世界活动数据集Charades上展示了结果。我们的Stacked-STGCN总体上在CAD120上以VGG特征相较最佳报道结果在F1分数上实现了4.0%的性能提升,在Charades上在mAP上实现了1.3%的提升。

关键词

引用

@article{arxiv.1811.10575,
  title  = {Stacked Spatio-Temporal Graph Convolutional Networks for Action Segmentation},
  author = {Pallabi Ghosh and Yi Yao and Larry S. Davis and Ajay Divakaran},
  journal= {arXiv preprint arXiv:1811.10575},
  year   = {2019}
}