用于多动作运动合成的循环 Transformer 变分自编码器
计算机视觉与模式识别
2022-06-28 v2
摘要
我们考虑合成任意长度的多动作人体运动序列的问题。现有方法已掌握单动作场景下的运动序列生成,但无法泛化到多动作与任意长度序列。我们通过提出一种新颖高效的方法来填补这一空白,该方法利用了循环 Transformer(Recurrent Transformers)的表达能力与条件变分自编码器(Variational Autoencoders)的生成丰富性。所提出的迭代方法能够以线性空间与时间生成具有任意数量动作与帧数的平滑且真实的人体运动序列。我们在 PROX 与 Charades 数据集上训练并评估所提方法,其中我们为 PROX 增补了真实动作标签,为 Charades 增补了人体网格标注。实验评估显示,相较于当前最优方法,FID 分数与语义一致性指标均有显著提升。
引用
@article{arxiv.2206.06741,
title = {Recurrent Transformer Variational Autoencoders for Multi-Action Motion Synthesis},
author = {Rania Briq and Chuhang Zou and Leonid Pishchulin and Chris Broaddus and Juergen Gall},
journal= {arXiv preprint arXiv:2206.06741},
year = {2022}
}
备注
accepted at Transformers for Vision workshop at CVPR 2022