中文

用于人体动力学的循环网络模型

计算机视觉与模式识别 2015-09-30 v2

摘要

我们提出 Encoder-Recurrent-Decoder (ERD) 模型,用于视频和动作捕捉中人体姿态的识别与预测。ERD 模型是一种循环神经网络,在循环层前后分别融合了非线性编码器和解码器网络。我们在动作捕捉(mocap)生成、人体姿态标注以及视频中人体姿态预测等任务上测试了 ERD 架构的实例。我们的模型处理跨多个对象和活动领域的 mocap 训练数据,并合成新颖运动,同时长时间避免漂移。对于人体姿态标注,ERD 通过解决左右身体部位混淆问题优于逐帧身体部位检测器。对于视频姿态预测,ERD 预测时间跨度 400ms 内的身体关节位移,并优于基于光流的一阶运动模型。ERD 扩展了文献中先前的长短期记忆(Long Short Term Memory, LSTM)模型,以联合学习表示及其动态。我们的实验表明,这种表示学习对于时空中的标注和预测都至关重要。我们发现这是时空视觉域与一维文本、语音或手写相比的一个区别特征,在后两者中,直接的硬编码表示在与循环单元直接结合时已展现出优异结果。

关键词

引用

@article{arxiv.1508.00271,
  title  = {Recurrent Network Models for Human Dynamics},
  author = {Katerina Fragkiadaki and Sergey Levine and Panna Felsen and Jitendra Malik},
  journal= {arXiv preprint arXiv:1508.00271},
  year   = {2015}
}

备注

International Conference on Computer Vision 2015