中文

面向语音驱动的个人化手势合成:利用自动模糊特征推断

广义相对论与量子宇宙学 2024-05-24 v2

摘要

语音驱动手势生成是虚拟人创建的一个新兴领域。然而,一个显著挑战在于准确确定和处理大量输入特征(如声学特征、语义特征、情感特征、人格特征以及甚至细微的未知特征)。传统方法依赖各种显式特征输入和复杂的多模态处理,限制了结果手势的表达性并限制了其适用性。为解决这些挑战,我们提出了 Persona-Gestor,一种新颖的端到端生成模型,仅依据原始语音音频生成高度个人化的3D全身手势。该模型结合了模糊特征提取器和非自回归自适应层归一化(AdaLN)转换器扩散架构。模糊特征提取器利用模糊推断策略自动推断隐式、连续的模糊特征。这些模糊特征作为统一的潜在特征输入到 AdaLN 转换器中。AdaLN 转换器引入一种条件机制, applies a uniform function across all tokens,从而有效地建模模糊特征与手势序列之间的相关性。该模块确保了较高水平的手势语音同步,同时保持自然性。最后,我们采用扩散模型进行手势的训练和推断。在 Trinity、ZEGGS 和 BEAT 数据集上进行的大量主观和客观评估确认了我们模型在当前最先进方法中的优越性能。Persona-Gestor 提升了系统的可用性和泛化能力,在语音驱动手势合成方面树立了新的基准,拓展了虚拟人技术的应用前景。补充视频和代码可在 https://zf223669.github.io/Diffmotion-v2-website/ 访问。

关键词

引用

@article{arxiv.2403.10804,
  title  = {Inspiral Time Probability Distribution for Two Black Holes Captured by Emitting Gravitational Radiation},
  author = {Don N. Page},
  journal= {arXiv preprint arXiv:2403.10804},
  year   = {2024}
}

备注

30 pages, aditional references added