时间卷积网络:一种统一的行为分割方法
计算机视觉与模式识别
2016-08-31 v1
摘要
基于视频的行为分割的主流范式由两个步骤组成:首先,使用密集轨迹或卷积神经网络为每一帧计算编码局部时空信息的低级特征;其次,将这些特征输入到能够捕捉高级时间关系的分类器中,例如循环神经网络(RNN)。虽然这种方法通常有效,但这种解耦需要指定两个独立的模型,各自具有其复杂性,并且阻碍了捕捉更细微的长程时空关系。我们提出了一种统一的方法,如我们的时间卷积网络(TCN)所示,该方法分层地捕捉低级、中级和高级时间尺度上的关系。我们的模型在三个公开的行为分割数据集上使用视频或传感器数据实现了优越或具有竞争力的性能,并且其训练时间仅为训练 RNN 所需时间的一小部分。
引用
@article{arxiv.1608.08242,
title = {Temporal Convolutional Networks: A Unified Approach to Action Segmentation},
author = {Colin Lea and Rene Vidal and Austin Reiter and Gregory D. Hager},
journal= {arXiv preprint arXiv:1608.08242},
year = {2016}
}
备注
Submitted to the ECCV workshop on "Brave new ideas for motion representations in videos" (http://bravenewmotion.github.io/)