ConvoFusion:面向共语姿态合成的多模态对话扩散
计算机视觉与模式识别
2024-03-27 v1
摘要
姿态在人类交流中起关键作用。最近的共语姿态生成方法虽然能够生成与音频信号自然对齐的节拍姿态,但在生成与言语语义一致的姿态方面存在挑战。与自然对齐于音频信号的节拍姿态相比,语义连贯的姿态需要建模语言与人类运动之间的复杂交互,并且可以通过关注特定单词来实现可控性。因此,我们提出了 ConvoFusion,这是一种基于扩散的多模态姿态合成方法,既能基于多模态语音输入生成姿态,又能实现姿态合成的可控性。我们的方法提出了两种指导目标,允许用户调节不同条件模态(如音频与文本)的影响程度,以及在姿态合成期间选择特定单词进行强调。我们的模型在方面非常灵活,可以用于生成单句话姿态甚至对话式姿态。为进一步推动多方交互姿态的研究,我们发布了 DnD 团体姿态数据集,其中包含 6 小时显示 5 个人相互交互的姿态数据。我们与几个最近的工作进行了比较,证明了该方法在各种任务上的有效性。我们敬请观看我们网站上的补充视频。
关键词
引用
@article{arxiv.2403.17936,
title = {ConvoFusion: Multi-Modal Conversational Diffusion for Co-Speech Gesture Synthesis},
author = {Muhammad Hamza Mughal and Rishabh Dabral and Ikhsanul Habibie and Lucia Donatelli and Marc Habermann and Christian Theobalt},
journal= {arXiv preprint arXiv:2403.17936},
year = {2024}
}
备注
CVPR 2024. Project Page: https://vcai.mpi-inf.mpg.de/projects/ConvoFusion/