中文

TricorNet:一种用于视频动作分割的混合时间卷积与循环网络

计算机视觉与模式识别 2017-05-23 v1

摘要

动作分割作为构建理解未修剪视频的自动系统的一个里程碑,近年来受到了相当多的关注。它通常被建模为序列标注问题,但与文本解析或语音处理有本质且充分的差异。在本文中,我们介绍了一种新颖的混合时间卷积与循环网络(TricorNet),其具有编码器-解码器架构:编码器由捕获不同动作局部运动变化的时间卷积核层次结构组成;解码器是循环神经网络的层次结构,能够在编码阶段后学习和记忆长期动作依赖关系。我们的模型简单但在视频序列标注方面极其有效。在三个公开动作分割数据集上的实验结果表明,所提模型取得了优于最先进技术的性能。

关键词

引用

@article{arxiv.1705.07818,
  title  = {TricorNet: A Hybrid Temporal Convolutional and Recurrent Network for Video Action Segmentation},
  author = {Li Ding and Chenliang Xu},
  journal= {arXiv preprint arXiv:1705.07818},
  year   = {2017}
}