C2G2:基于潜扩散模型的可控语音协同手势生成
计算机视觉与模式识别
2023-08-30 v1
摘要
语音协同手势生成对于自动数字虚拟人动画至关重要。然而,现有方法存在训练不稳定与时间不一致等问题,尤其在生成高保真且完备的手势时。此外,这些方法缺乏对说话人身份及生成手势时间编辑的有效控制。聚焦于捕捉时间潜信息与应用实用控制,我们提出名为 C2G2 的可控语音协同手势生成框架。具体而言,受潜扩散模型启发,我们提出一种两阶段时间依赖增强策略。我们进一步为 C2G2 引入两个关键特性,即用于生成说话人相关真实长度骨架的说话人特定解码器,以及用于灵活手势生成/编辑的重绘策略。在基准手势数据集上的大量实验验证了我们所提 C2G2 相较若干最先进基线的有效性。项目演示页链接见 https://c2g2-gesture.github.io/c2_gesture
引用
@article{arxiv.2308.15016,
title = {C2G2: Controllable Co-speech Gesture Generation with Latent Diffusion Model},
author = {Longbin Ji and Pengfei Wei and Yi Ren and Jinglin Liu and Chen Zhang and Xiang Yin},
journal= {arXiv preprint arXiv:2308.15016},
year = {2023}
}
备注
12 pages, 6 figures, 7 tables