SIGesture:基于语义注入的大规模预训练扩散模型通用协同语音手势合成
人机交互
2024-09-24 v2
摘要
从语音合成高质量3D手势的自动化方法在虚拟人类和游戏领域具有重要价值。以往的方法关注与语音节奏同步的手势合成,却常常忽略了语义手势的包含。这些手势稀疏且在手势序列中呈长尾分布,使其难以以端到端方式学习。此外,生成与语音节奏同步的手势面临一个无法针对野生语音进行泛化的显著问题。为此,我们引入SIGesture,一种新的基于扩散模型的方法,用于合成高质量且语义相关的手势。具体而言,我们首先在收集的大规模带伪标签数据集上预训练了一个强大的基于扩散模型的节奏手势合成基础模型。其次,我们利用大语言模型(LLM)的强大泛化能力为各种语音内容生成适当的语义手势。最后,我们提出了一个语义注入模块,用于在扩散逆过程中将语义信息注入合成结果。广泛的实验表明,所提出的SIGGesture显著优于现有基线,显示出卓越的泛化性和可控性。
引用
@article{arxiv.2405.13336,
title = {SIGGesture: Generalized Co-Speech Gesture Synthesis via Semantic Injection with Large-Scale Pre-Training Diffusion Models},
author = {Qingrong Cheng and Xu Li and Xinghui Fu and Fei Xia and Zhongqian Sun},
journal= {arXiv preprint arXiv:2405.13336},
year = {2024}
}
备注
13 pages, siggraph asia 2024,