Hallo: 基于层次化音频驱动的肖像图像动画
计算机视觉与模式识别
2024-06-18 v2
摘要
肖像图像动画领域已取得显著进展,尤其是在以语音音频为输入时生成逼真且动态的肖像。该研究深入探讨了在扩散方法框架下同步面部动作并创建视觉上吸引且在时间上一致的动画的复杂性。我们摆脱了依赖参数化模型进行中间面部表示的传统范式,采用端到端的扩散范式,引入层次化音频驱动的视觉合成模块,以提高音频输入与视觉输出之间(包括唇形、表情和姿态动作)对齐精度。我们提出的网络架构无缝集成了扩散生成模型、基于 UNet 的去噪器、时间对齐技术以及参考网络。所提出的层次化音频驱动的视觉合成提供了对表情和姿态多样性的自适应控制,使更有效地针对不同身份进行个性化定制。通过综合评估,包括定性和定量分析,我们的方法在图像和视频质量、唇部同步精度以及运动多样性方面均实现了显著提升。更多可视化结果及源码访问请参见: https://fudan-generative-vision.github.io/hallo。
引用
@article{arxiv.2406.08801,
title = {Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation},
author = {Mingwang Xu and Hui Li and Qingkun Su and Hanlin Shang and Liwei Zhang and Ce Liu and Jingdong Wang and Yao Yao and Siyu Zhu},
journal= {arXiv preprint arXiv:2406.08801},
year = {2024}
}
备注
20 pages