MANGO:基于2D提升的自然多说者3D说话头生成
计算机视觉与模式识别
2026-01-06 v1
摘要
当前面向音频驱动的3D头部生成方法主要聚焦于单说话者场景,缺乏自然的、双向的听说交互。实现顺畅的对话行为,使得说话和倾听状态之间实现流畅的转换,是现有3D对话化身方法面临的关键挑战。现有的3D对话化身方法依赖于误差可靠的伪3D标签,无法捕捉面部细粒度动态。为此,我们引入一种新型的两阶段框架MANGO,通过交替训练以纯图像级监督,缓解伪3D标签引入的噪声,从而更好地符合真实世界对话行为。在第一阶段,一个基于扩散的变换器配合双音频交互模块建模自然的3D运动。在第二阶段,我们使用快速的3D高斯渲染器生成高保真图像,并通过交替训练为3D运动提供2D层面的光度监督。此外,我们引入了MANGO-Dialog,一个拥有超过50小时的对齐2D-3D对话数据的高质量数据集,覆盖500多个身份。大量实验表明,我们的方法在建模两人3D对话运动方面实现了卓越的准确性和真实性,显著提升了音频驱动说话头的保真度和可控性。
引用
@article{arxiv.2601.01749,
title = {MANGO:Natural Multi-speaker 3D Talking Head Generation via 2D-Lifted Enhancement},
author = {Lei Zhu and Lijian Lin and Ye Zhu and Jiahao Wu and Xuehan Hou and Yu Li and Yunfei Liu and Jie Chen},
journal= {arXiv preprint arXiv:2601.01749},
year = {2026}
}
备注
20 pages, 11i figures