利用多粒度模型与自适应渲染学习预测人类活动视频
计算机视觉与模式识别
2017-12-07 v1
摘要
我们提出一种用于预测涉及多人的复杂人类活动视频的方法。直接的像素级预测过于简单,无法处理复杂活动中外观的变化。因此,我们开发了新颖的中间表示。提出了一种结合用于预测人体姿态的分层时间模型和用于渲染目标外观的编码器-解码器卷积神经网络的架构。我们的分层模型通过采用基于动态群体的交互机制来捕捉人与人之间的交互。接下来,我们的外观渲染网络通过使用全卷积网络学习自适应外观滤波器来编码目标的外观。最后,这些滤波器被置于编码器-解码器神经网络中以完成渲染。我们证明我们的模型能够生成优于最先进方法的视频,并且能够处理视频预测中的复杂人类活动场景。
引用
@article{arxiv.1712.01955,
title = {Learning to Forecast Videos of Human Activity with Multi-granularity Models and Adaptive Rendering},
author = {Mengyao Zhai and Jiacheng Chen and Ruizhi Deng and Lei Chen and Ligeng Zhu and Greg Mori},
journal= {arXiv preprint arXiv:1712.01955},
year = {2017}
}