中文

BodyFormer:基于语义引导 Transformer 的 3D 身体姿态合成

计算机视觉与模式识别 2023-10-12 v1 人工智能 图形学

摘要

从语音自动合成手势是一个吸引研究者的课题,在远程通信、视频游戏和元宇宙中有应用。由于问题的随机性以及缺乏训练所需的丰富跨模态数据集,学习语音与 3D 全身手势之间的映射十分困难。本文中,我们提出了一种基于 Transformer 的新框架,用于从语音自动合成 3D 身体手势。为学习语音过程中身体手势的随机性,我们提出一种变分 Transformer 来有效建模手势上的概率分布,从而在推理时产生多样化手势。此外,我们引入了一种模式位置嵌入层来捕捉不同说话模式下的不同运动速度。为应对数据稀缺,我们设计了一种单模态预训练方案,可从有限数据中学习语音与 3D 手势之间的复杂映射。我们的系统使用 Trinity 语音-手势数据集或 Talking With Hands 16.2M 数据集进行训练。结果表明,与现有最先进方法相比,我们的系统能生成更真实、更恰当且更多样的身体手势。

关键词

引用

@article{arxiv.2310.06851,
  title  = {BodyFormer: Semantics-guided 3D Body Gesture Synthesis with Transformer},
  author = {Kunkun Pang and Dafei Qin and Yingruo Fan and Julian Habekost and Takaaki Shiratori and Junichi Yamagishi and Taku Komura},
  journal= {arXiv preprint arXiv:2310.06851},
  year   = {2023}
}

备注

12 pages, 13 figures