中文

LSTM 姿态机

计算机视觉与模式识别 2018-03-12 v4

摘要

我们观察到,近期单图像人体姿态估计的最优结果由多阶段卷积神经网络(CNN)取得。尽管在静态图像上性能优越,这些模型在视频上的应用不仅计算密集,还存在性能退化与闪烁问题。此类次优结果主要归因于无法施加序列几何一致性、难以处理严重的图像质量退化(如运动模糊与遮挡),以及无法捕捉视频帧间的时间相关性。本文中,我们提出了一种新颖的循环网络来解决这些问题。我们表明,若对多阶段 CNN 施加权值共享方案,其可重写为循环神经网络(RNN)。该特性解耦了多个网络阶段间的关系,并显著加快了视频中网络调用的速度。它还使得在视频帧间采用长短期记忆(LSTM)单元成为可能。我们发现这种记忆增强的 RNN 在施加帧间几何一致性上非常有效,亦能较好处理视频中的输入质量退化,同时成功稳定序列输出。实验表明,我们的方法在两个大规模视频姿态估计基准上显著优于当前最优方法。我们还探究了 LSTM 内部的记忆单元,并阐释了此种机制有益于基于视频的姿态估计预测的原因。

关键词

引用

@article{arxiv.1712.06316,
  title  = {LSTM Pose Machines},
  author = {Yue Luo and Jimmy Ren and Zhouxia Wang and Wenxiu Sun and Jinshan Pan and Jianbo Liu and Jiahao Pang and Liang Lin},
  journal= {arXiv preprint arXiv:1712.06316},
  year   = {2018}
}

备注

Poster in IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2018