基于混合 Transformer-Mamba 模型的语音驱动 3D 说话者头部生成 -- JambaTalk
计算机视觉与模式识别
2025-12-09 v3
摘要
近年来,说话者头部生成成为研究人员的焦点。人们正在努力改进唇部同步动作、捕捉表情化表情、生成自然头部姿态,并实现高质量视频。然而,目前尚无单个模型在所有定量和定性指标上都能实现等价。我们引入 Jamba,一种混合 Transformer-Mamba 模型,用于对 3D 人脸进行动画处理。Mamba 是一种新的结构化状态空间模型 (SSM) 架构,旨在克服传统 Transformer 架构的局限性,特别是在处理长序列方面的限制。这一挑战一直限制了传统模型。Jamba 结合了 Transformer 和 Mamba 方法的优势,为综合解决方案提供了全面的方案。基于 Jamba 基本模块,我们提出 JambaTalk 通过多模态集成来增强动作多样性和唇部同步。大量实验表明,我们的方法在性能上与最新模型相当或优于最新模型。
关键词
引用
@article{arxiv.2408.01627,
title = {JambaTalk: Speech-Driven 3D Talking Head Generation Based on Hybrid Transformer-Mamba Model},
author = {Farzaneh Jafari and Stefano Berretti and Anup Basu},
journal= {arXiv preprint arXiv:2408.01627},
year = {2025}
}
备注
23 pages with 8 figures