中文

MS-TCN++:用于动作分割的多阶段时间卷积网络

计算机视觉与模式识别 2020-09-04 v2

摘要

随着深度学习在短时长裁剪视频分类中的成功,更多注意力集中于对长时长未裁剪视频中的活动进行时间分割与分类。动作分割的最先进方法利用了若干层时间卷积与时间池化。尽管这些方法在捕捉时间依赖方面具有能力,其预测仍存在过分割错误。在本文中,我们提出一种用于时间动作分割任务的多阶段架构,克服了先前方法的局限。第一阶段生成初始预测,并由后续阶段精炼。在每个阶段中,我们堆叠若干层膨胀时间卷积,以极少参数覆盖大感受野。尽管该架构已表现良好,较低层仍受限于小感受野。为应对此局限,我们提出一种结合大与小感受野的双重膨胀层。我们进一步将第一阶段与精炼阶段的设计解耦,以满足这些阶段的不同需求。大量评估显示了所提模型在捕捉长程依赖与识别动作片段上的有效性。我们的模型在三个数据集上取得最先进结果:50Salads、Georgia Tech Egocentric Activities (GTEA) 与 Breakfast 数据集。

关键词

引用

@article{arxiv.2006.09220,
  title  = {MS-TCN++: Multi-Stage Temporal Convolutional Network for Action Segmentation},
  author = {Shijie Li and Yazan Abu Farha and Yun Liu and Ming-Ming Cheng and Juergen Gall},
  journal= {arXiv preprint arXiv:2006.09220},
  year   = {2020}
}

备注

IEEE Transactions on Pattern Analysis and Machine Intelligence. arXiv admin note: substantial text overlap with arXiv:1903.01945