Hallo3:基于视频扩散 Transformer 的高度动态逼真人物画像动画
计算机视觉与模式识别
2025-03-14 v4 图形学
机器学习
摘要
现有的人物图像动画方法在处理非正面视角、渲染人物周围的动态物体以及生成沉浸式逼真背景方面面临诸多挑战。本文首次应用预训练的基于 Transformer 的视频生成模型,展示出强大的泛化能力,可为人物动画生成高度动态逼真的视频,从而有效解决上述挑战。采用新的视频 backbone 模型后,无法直接应用用于身份保持、音频条件和视频外推的 U-Net 方法。为此,我们设计了一个由因果 3D VAE 结合堆叠的 Transformer 层组成的身份参考网络,确保视频序列中面部身份的一致性。此外,我们研究了各种语音音频条件和运动帧机制,以实现由语音音频驱动连续视频的生成。我们在基准数据集和新提出的野生数据集上进行实验,证明我们的方法在生成以多样化姿态为特征的动态沉浸场景中逼真的人物画像方面显著优于先前方法。更多可视化和源代码请访问:https://fudan-generative-vision.github.io/hallo3/。
引用
@article{arxiv.2412.00733,
title = {Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer},
author = {Jiahao Cui and Hui Li and Yun Zhan and Hanlin Shang and Kaihui Cheng and Yuqi Ma and Shan Mu and Hang Zhou and Jingdong Wang and Siyu Zhu},
journal= {arXiv preprint arXiv:2412.00733},
year = {2025}
}