基于扩散模型与混合音频-文本引导的表达性说话人生成 ExpGest
声音
2026-03-10 v2 计算机视觉与模式识别
音频与语音处理
摘要
现有的手势生成方法主要关注基于音频特征的上半身手势,忽略了语音内容、情感和 locomotion。这些限制导致手势僵硬、机械,无法传达音频内容的真实含义。我们提出 ExpGest,一种新框架利用同步的文本和音频信息生成表达性全身手势。不同于 AdaIN 或 one-hot 编码方法,我们设计了噪声情感分类器,用于优化对抗性噪声方向,避免旋律失真并引导结果朝指定情感方向发展。此外,语义与手势在潜在空间中的对齐提供了更好的泛化能力。ExpGest 是一种基于扩散模型的手势生成框架,是首次尝试提供混合生成模式,包括音频驱动手势和文本驱动运动。实验表明,我们的框架有效学习了结合文本驱动运动和音频引导手势数据集,初步结果表明 ExpGest 在说话人全局运动方面实现了更具表达性、自然且可控的生成,优于当前最先进的模型。
引用
@article{arxiv.2410.09396,
title = {ExpGest: Expressive Speaker Generation Using Diffusion Model and Hybrid Audio-Text Guidance},
author = {Yongkang Cheng and Mingjiang Liang and Shaoli Huang and Gaoge Han and Jifeng Ning and Wei Liu},
journal= {arXiv preprint arXiv:2410.09396},
year = {2026}
}
备注
Accepted by ICME 2024