基于姿态的多重未来长期人体视频生成
计算机视觉与模式识别
2021-06-02 v4
摘要
从输入人体视频预测未来人类行为对自动驾驶与机器人等应用是有用的任务。尽管多数先前工作预测单一未来,但具有不同行为的多重未来有可能发生。此外,若预测未来过短(如小于一秒),它可能无法被人类或其他系统完全使用。本文中,我们提出一种能预测多重长期未来的新颖未来人体姿态预测方法。这使预测更适用于真实应用。并且,从输入视频与预测人体行为,我们生成未来视频。首先,从输入人体视频,我们通过对抗学习生成未来人体姿态序列(即其身体关节的图像坐标)。对抗学习受模式崩溃困扰,难以生成多样多重姿态。我们通过向生成器引入两个额外输入使输出多样来解决该问题,即潜码(反映各种行为)与吸引点(反映各种轨迹)。此外,我们基于一维卷积神经网络的新方法生成长期未来人体姿态。最后,我们基于生成姿态生成输出视频以可视化。我们使用三项准则(即真实感、多样性与准确性)评估生成的未来姿态与视频,并表明我们所提方法优于其他 state-of-the-art 工作。
引用
@article{arxiv.1904.07538,
title = {Long-Term Human Video Generation of Multiple Futures Using Poses},
author = {Naoya Fushishita and Antonio Tejero-de-Pablos and Yusuke Mukuta and Tatsuya Harada},
journal= {arXiv preprint arXiv:1904.07538},
year = {2021}
}