中文

Stereo-Talker:基于先验引导的混合专家模型的音频驱动3D人类合成

计算机视觉与模式识别 2026-03-02 v1

摘要

本文介绍了Stereo-Talker,一种新颖的单 shot 音频驱动人类视频合成系统,能够生成精准的唇部同步、具有表现力的身体姿势、时序一致的逼真质量以及连续的视角控制。该系统遵循两阶段方法。在第一阶段,系统将音频输入映射到高保真运动序列中,包括上身姿势和面部表情。为丰富运动的多样性和真实性,引入大型语言模型(LLM)先验与文本对齐的语义音频特征,利用LLM的跨模态泛化能力以提升运动质量。在第二阶段,我们通过引入先验引导的混合专家(MoE)机制来改进基于扩散的视频生成模型:一种视角引导的MoE聚焦于视角特定属性,而一种掩码引导的MoE增强区域级渲染稳定性。此外,我们设计了一个掩码预测模块,从运动数据中推导出人类掩码,以提升掩码的稳定性和准确性,并在推理过程中实现掩码引导。我们还引入了一套全面的人类视频数据集,包含2203个身份信息,涵盖多样的身体姿势和详细的注释,促进广泛的泛化。将为研究目的发布代码、数据和预训练模型。

关键词

引用

@article{arxiv.2410.23836,
  title  = {Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts},
  author = {Xiang Deng and Youxin Pang and Xiaochen Zhao and Chao Xu and Lizhen Wang and Hongjiang Xiao and Shi Yan and Hongwen Zhang and Yebin Liu},
  journal= {arXiv preprint arXiv:2410.23836},
  year   = {2026}
}