中文

面向协同语气姿态生成的DiM-Gestor:自适应层归一化Mamba-2

声音 2024-11-28 v1 人工智能 图形学 人机交互 多媒体 音频与语音处理

摘要

基于Transformer的生成模型用于语音驱动姿态生成已成为虚拟人创建领域的快速发展方向。然而,现有模型因其二次时间和空间复杂度限制,导致可扩展性和效率受限。为此,我们引入DiM-Gestor,这是一种创新的端到端生成模型,利用Mamba-2架构。DiM-Gestor具备双组件框架:(1)一种模糊特征提取器,(2)一种语音到姿态的映射模块,两者均基于Mamba-2构建。集成中文预训练模型和Mamba-2的模糊特征提取器,能够自主提取隐式、连续的语音特征。这些特征被合成为统一的潜在表示,然后由语音到姿态的映射模块处理。该模块采用自适应层归一化(AdaLN)增强的Mamba-2机制,以统一方式对所有序列标记应用变换,从而精确建模语音特征与姿态动态之间的细微相互作用。我们利用扩散模型进行训练和推断,以生成多样化的姿态输出。在新发布的中文协同语气姿态数据集上进行的大规模主观和客观评估,证实了我们提出模型的有效性。与基于Transformer的架构相比,评估显示,我们的方法在结果方面具有竞争力,显著降低了内存使用约2.4倍,并提升了推理速度2到4倍。此外,我们发布了CCG数据集,即中文协同语气姿态数据集,包含15.97小时(跨六种风格的五种情景)的3D全身骨骼姿态动作,由专业中文电视主持人执行。

关键词

引用

@article{arxiv.2411.16729,
  title  = {DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2},
  author = {Fan Zhang and Siyuan Zhao and Naye Ji and Zhaohan Wang and Jingmei Wu and Fuxing Gao and Zhenqing Ye and Leyao Yan and Lanxin Dai and Weidong Geng and Xin Lyu and Bozuo Zhao and Dingguo Yu and Hui Du and Bin Hu},
  journal= {arXiv preprint arXiv:2411.16729},
  year   = {2024}
}

备注

13 pages, 11 figures