中文

MambaGesture:利用 Mamba 与解缠多模态融合提升共语气体生成

人机交互 2024-08-29 v2 多媒体

摘要

共语气体生成对于产生与语音同步且具备真实感的人类手势至关重要,这有助于提升虚拟环境中逼真角色的动画效果。虽然扩散模型展现了令人瞩目的能力,但当前方法常忽视多种模态及其相互作用,导致生成的手势缺乏动态性和情境多样性。为此,本文提出 MambaGesture 框架,集成 Mamba 注意力模块 MambaAttn 与多模态特征融合模块 SEAD。MambaAttn 将 Mamba 模型在序列数据处理方面的优势与注意力机制在情境丰富性方面的能力相结合,增强生成手势的时序一致性。SEAD 能熟练融合音频、文本、风格与情感等模态,采用解缠技术深化融合过程,生成更具真实感与多样性的手势。本方法在多模态 BEAT 数据集上进行严格评估,显著改善 FGD 指标、多样性评分及拍击对齐效果,实现共语气体生成的领先性能。项目网址:\href\href{https://fcchit.github.io/mambagesture/}{\textit{https://fcchit.github.io/mambagesture/}}

关键词

引用

@article{arxiv.2407.19976,
  title  = {MambaGesture: Enhancing Co-Speech Gesture Generation with Mamba and Disentangled Multi-Modality Fusion},
  author = {Chencan Fu and Yabiao Wang and Jiangning Zhang and Zhengkai Jiang and Xiaofeng Mao and Jiafu Wu and Weijian Cao and Chengjie Wang and Yanhao Ge and Yong Liu},
  journal= {arXiv preprint arXiv:2407.19976},
  year   = {2024}
}

备注

Accepted by ACM MM 2024