HunyuanVideo-Avatar:面向多角色的高保真音频驱动人体动画
计算机视觉与模式识别
2025-06-04 v2
摘要
近年来,音频驱动的人体动画取得了显著进展。然而,在以下方面仍然存在关键挑战:(i)在生成高动态视频的同时保持角色一致性,(ii)实现角色与音频之间精确的情感对齐,以及(iii)实现多角色音频驱动动画。为了解决这些挑战,我们提出了 HunyuanVideo-Avatar,这是一个基于多模态扩散 Transformer(MM-DiT)的模型,能够同时生成动态、情感可控的多角色对话视频。具体而言,HunyuanVideo-Avatar 引入了三项关键创新:(i)设计了一个角色图像注入模块,以取代传统的基于加法的角色条件化方案,消除了训练和推理之间固有的条件不匹配问题。这确保了动态运动和强大的角色一致性;(ii)引入了一个音频情感模块(AEM),用于从情感参考图像中提取情感线索并将其迁移到目标生成视频中,从而实现细粒度且精确的情感风格控制;(iii)提出了一个人脸感知音频适配器(FAA),利用隐空间级别的人脸掩码来隔离音频驱动的角色,从而通过交叉注意力机制为多角色场景实现独立的音频注入。这些创新使 HunyuanVideo-Avatar 在基准数据集和一个新提出的真实场景数据集上超越了最先进的方法,能够在动态、沉浸式场景中生成逼真的虚拟形象。
引用
@article{arxiv.2505.20156,
title = {HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters},
author = {Yi Chen and Sen Liang and Zixiang Zhou and Ziyao Huang and Yifeng Ma and Junshu Tang and Qin Lin and Yuan Zhou and Qinglin Lu},
journal= {arXiv preprint arXiv:2505.20156},
year = {2025}
}