中文

Hallo4:基于直接偏好优化的高保真动态肖像动画

计算机视觉与模式识别 2025-12-02 v4

摘要

由于需要精确的唇部同步、自然的面部表情和高保真的身体运动动力学,生成由音频和骨骼运动驱动的高度动态且逼真的肖像动画仍然具有挑战性。我们提出了一个与人类偏好对齐的扩散框架,通过两项关键创新来解决这些挑战。首先,我们引入了针对以人为中心的动画量身定制的直接偏好优化,利用精选的人类偏好数据集,将生成的输出与肖像运动-视频对齐和表情自然度的感知指标对齐。其次,提出的时序运动调制通过时间通道重分配和比例特征扩展,将运动条件重塑为维度对齐的潜在特征,解决了时空分辨率不匹配问题,从而在基于扩散的合成中保留了高频运动细节的保真度。所提出的机制是对现有基于 UNet 和 DiT 的肖像扩散方法的补充,实验表明,与基线方法相比,在唇音同步、表情生动性、身体运动连贯性方面有明显提升,并在人类偏好指标上也有显著增益。我们的模型和源代码可在以下地址找到:https://github.com/fudan-generative-vision/hallo4。

关键词

引用

@article{arxiv.2505.23525,
  title  = {Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization},
  author = {Jiahao Cui and Yan Chen and Mingwang Xu and Hanlin Shang and Yuxuan Chen and Yun Zhan and Zilong Dong and Yao Yao and Jingdong Wang and Siyu Zhu},
  journal= {arXiv preprint arXiv:2505.23525},
  year   = {2025}
}