中文

超越对话——生成用于交流的整体 3D 人类双人运动

计算机视觉与模式识别 2024-03-29 v1

摘要

在本文中,我们引入了一项专注于人类交流的创新任务,旨在为说话者和听众生成 3D 整体人类运动。我们方法的核心是引入分解来解耦音频特征并结合文本语义信息,从而促进更真实和协调运动的创建。我们分别针对说话者和听众的整体运动训练了 VQ-VAE。我们考虑了说话者与听众之间的实时相互影响,并提出了一种新颖的基于 Transformer 的链式自回归模型,该模型专门设计用于有效表征真实交流场景,能够同时生成说话者和听众的运动。这些设计确保了我们生成的结果既协调又多样。我们的方法在两个基准数据集上展示了 SOTA 性能。此外,我们引入了 HoCo 整体交流数据集,这是未来研究的宝贵资源。我们的 HoCo 数据集和代码将在被接受后发布以供研究使用。

关键词

引用

@article{arxiv.2403.19467,
  title  = {Beyond Talking -- Generating Holistic 3D Human Dyadic Motion for Communication},
  author = {Mingze Sun and Chao Xu and Xinyu Jiang and Yang Liu and Baigui Sun and Ruqi Huang},
  journal= {arXiv preprint arXiv:2403.19467},
  year   = {2024}
}