基于解耦潜扩散的情感语音驱动三维人体动画
计算机视觉与模式识别
2026-04-01 v3
摘要
现有从语音合成三维人体手势的方法已展现出令人鼓舞的结果,但它们并未显式建模情感对所生成手势的影响。相反,这些方法直接从语音输出动画,而无法控制所表达的情感。为解决这一局限,我们提出了 AMUSE,一个基于潜扩散的情感语音驱动人体动画模型。我们的观察是,内容(即与语音节奏和词语发音相关的手势)、情感和个人风格是可分离的。为此,AMUSE 将驱动音频映射到三个解耦的潜向量:一个用于内容,一个用于情感,一个用于个人风格。然后,一个经过训练以生成手势运动序列的潜扩散模型以这些潜向量为条件。训练完成后,AMUSE 直接从语音合成三维人体手势,并通过将驱动语音的内容与另一语音序列的情感和风格相结合,来控制所表达的情感和风格。对扩散模型的噪声进行随机采样,可进一步生成具有相同情感表现力的手势变体。定性、定量和感知评估表明,AMUSE 能输出逼真的手势序列。与现有最优技术相比,生成的手势与语音内容同步性更好,并能更好地表现输入语音所表达的情感。我们的代码可在 amuse.is.tue.mpg.de 获取。
引用
@article{arxiv.2312.04466,
title = {Emotional Speech-driven 3D Body Animation via Disentangled Latent Diffusion},
author = {Kiran Chhatre and Radek Daněček and Nikos Athanasiou and Giorgio Becherini and Christopher Peters and Michael J. Black and Timo Bolkart},
journal= {arXiv preprint arXiv:2312.04466},
year = {2026}
}
备注
Conference on Computer Vision and Pattern Recognition (CVPR) 2024. Webpage: https://amuse.is.tue.mpg.de/