MS-TCN:用于动作分割的多阶段时间卷积网络
计算机视觉与模式识别
2019-04-03 v2
摘要
在长未修剪视频中时间定位并分类动作片段,对监控和机器人等诸多应用尤为关键。传统方法遵循两步流程,即生成逐帧概率再输入高层时间模型,而近期方法使用时间卷积直接对视频帧分类。本文中,我们为时间动作分割任务引入了一种多阶段架构。每个阶段配备一组膨胀时间卷积以生成初始预测,并由下一阶段精炼。该架构采用分类损失与一种所提出的平滑损失联合训练,后者惩罚过分割错误。大量评估显示了所提模型在捕获长程依赖与识别动作片段上的有效性。我们的模型在三个具挑战性数据集上取得了最先进结果:50Salads、Georgia Tech Egocentric Activities (GTEA) 与 Breakfast 数据集。
引用
@article{arxiv.1903.01945,
title = {MS-TCN: Multi-Stage Temporal Convolutional Network for Action Segmentation},
author = {Yazan Abu Farha and Juergen Gall},
journal= {arXiv preprint arXiv:1903.01945},
year = {2019}
}
备注
CVPR 2019 Camera Ready