Co$^{3}$Gesture:利用交互式扩散实现连贯的并发语音同步3D手势生成
计算机视觉与模式识别
2025-05-06 v1
摘要
从人类语音生成手势在虚拟化身动画方面取得了巨大进展。虽然现有方法能够合成由个体自言自语配合的手势,但它们忽略了双人交互对话中并发手势建模的实用性。此外,缺乏高质量的并发语音同步手势数据集也限制了对此问题的处理。为了实现这一目标,我们首先构建了一个大规模的并发语音同步手势数据集,该数据集包含超过700万帧用于多样化双人交互姿态序列,称为GES-Inter。此外,我们提出了CoGesture,这是一个新颖的框架,能够实现连贯的并发语音同步手势合成,包括双人交互动作。考虑到两个说话者的不对称身体动态,我们的框架建立在两个以分离的说话者音频为条件的协作生成分支之上。具体来说,为了在与对话伙伴交互时增强人体姿态相对于相应说话者音频的协调性,我们提出了一个时序交互模块(TIM)。TIM可以有效地建模两个说话者手势序列之间的时序关联表示,作为交互引导,并将其融合到并发手势生成中。然后,我们设计了一种相互注意力机制,以进一步整体地增强对交互并发运动的学习依赖性,从而使我们能够生成生动且连贯的手势。大量实验表明,在我们新收集的GES-Inter数据集上,我们的方法优于最先进的模型。数据集和源代码已公开,网址为\href{https://mattie-e.github.io/Co3/}{\textit{https://mattie-e.github.io/Co3/}}。
引用
@article{arxiv.2505.01746,
title = {Co$^{3}$Gesture: Towards Coherent Concurrent Co-speech 3D Gesture Generation with Interactive Diffusion},
author = {Xingqun Qi and Yatian Wang and Hengyuan Zhang and Jiahao Pan and Wei Xue and Shanghang Zhang and Wenhan Luo and Qifeng Liu and Yike Guo},
journal= {arXiv preprint arXiv:2505.01746},
year = {2025}
}
备注
Accepted as ICLR 2025 (Spotlight)