TricorNet:一种用于视频动作分割的混合时间卷积与循环网络
计算机视觉与模式识别
2017-05-23 v1
摘要
动作分割作为构建理解未修剪视频的自动系统的一个里程碑,近年来受到了相当多的关注。它通常被建模为序列标注问题,但与文本解析或语音处理有本质且充分的差异。在本文中,我们介绍了一种新颖的混合时间卷积与循环网络(TricorNet),其具有编码器-解码器架构:编码器由捕获不同动作局部运动变化的时间卷积核层次结构组成;解码器是循环神经网络的层次结构,能够在编码阶段后学习和记忆长期动作依赖关系。我们的模型简单但在视频序列标注方面极其有效。在三个公开动作分割数据集上的实验结果表明,所提模型取得了优于最先进技术的性能。
引用
@article{arxiv.1705.07818,
title = {TricorNet: A Hybrid Temporal Convolutional and Recurrent Network for Video Action Segmentation},
author = {Li Ding and Chenliang Xu},
journal= {arXiv preprint arXiv:1705.07818},
year = {2017}
}