迈向多变且协调的整体协同语音动作生成
计算机视觉与模式识别
2024-04-16 v2
摘要
本文解决了为 3D 虚拟人生成逼真整体协同语音动作的问题,重点关注两个关键方面:多变性和协调性。多变性使虚拟人即使在语音内容相似的情况下也能展现出广泛的动作,而协调性确保了面部表情、手势和身体姿态之间的和谐一致。我们旨在通过 ProbTalk 实现这两个目标,这是一个统一的概率框架,旨在联合建模语音中的面部、手部和身体动作。ProbTalk 建立在变分自编码器(VAE)架构之上,并融合了三个核心设计。首先,我们将乘积量化(PQ)引入 VAE,丰富了复杂整体动作的表示。其次,我们设计了一种新颖的非自回归模型,将 2D 位置编码嵌入到乘积量化表示中,从而保留了 PQ 码的基本结构信息。最后,我们采用第二阶段来细化初步预测,进一步锐化高频细节。结合这三个设计使 ProbTalk 能够生成自然且多样的整体协同语音动作,在定性和定量评估中优于几种最先进的方法,特别是在真实感方面。我们的代码和模型将出于研究目的在 https://feifeifeiliu.github.io/probtalk/ 发布。
引用
@article{arxiv.2404.00368,
title = {Towards Variable and Coordinated Holistic Co-Speech Motion Generation},
author = {Yifei Liu and Qiong Cao and Yandong Wen and Huaiguang Jiang and Changxing Ding},
journal= {arXiv preprint arXiv:2404.00368},
year = {2024}
}
备注
CVPR 2024