中文

EmotionGesture:音频驱动的多样化情感协同语音3D手势生成

计算机视觉与模式识别 2024-01-04 v2 人工智能 多媒体

摘要

生成生动多样的3D协同语音手势对于动画虚拟形象的各种应用至关重要。虽然大多数现有方法可以直接从音频生成手势,但它们通常忽视了情感是真实协同语音手势生成的关键因素之一。在这项工作中,我们提出EmotionGesture,一种从音频合成生动多样情感协同语音3D手势的新颖框架。考虑到情感常与语音音频中的节奏节拍纠缠在一起,我们首先开发了情感-节拍挖掘模块(EBM)来提取情感和音频节拍特征,并通过基于转录文本的视觉-节奏对齐来建模它们的相关性。然后,我们提出一种基于初始姿态的空间-时间提示器(STP)从给定初始姿态生成未来手势。STP有效建模了初始姿态与未来手势之间的空间-时间相关性,从而生成空间-时间连贯的姿态提示。一旦获得姿态提示、情感和音频节拍特征,我们将通过transformer架构生成3D协同语音手势。然而,考虑到现有数据集的姿态常包含抖动效应,这将导致生成不稳定的手势。为解决此问题,我们提出一种有效的目标函数,称为运动平滑损失(Motion-Smooth Loss)。具体而言,我们通过强制手势平滑来建模运动偏移以补偿抖动的真实值。最后,我们提出一个情感条件VAE来采样情感特征,使我们能够生成多样的情感结果。大量实验表明,我们的框架优于最先进水平,实现了生动多样的情感协同语音3D手势。我们的代码和数据集将于项目页面发布:https://xingqunqi-lab.github.io/Emotion-Gesture-Web/

关键词

引用

@article{arxiv.2305.18891,
  title  = {EmotionGesture: Audio-Driven Diverse Emotional Co-Speech 3D Gesture Generation},
  author = {Xingqun Qi and Chen Liu and Lincheng Li and Jie Hou and Haoran Xin and Xin Yu},
  journal= {arXiv preprint arXiv:2305.18891},
  year   = {2024}
}

备注

Under review