Hallo2:长时长与高分辨率音频驱动肖像图像动画
计算机视觉与模式识别
2024-10-15 v2
摘要
最近的潜在扩散生成模型在肖像图像动画中取得了显著进展,如 Hallo 在短时长视频合成方面取得了惊人的成果。本文对 Hallo 进行更新,引入若干设计优化以拓展其功能。首先,我们将方法扩展以生成长时长视频。为解决诸如外观漂移和时间性失真等重大挑战,我们研究了条件运动帧图像空间中的数据增强策略。具体而言,我们引入一种结合高斯噪声的 patch-drop 技术,以增强长时长视频中视觉一致性和时间一致性。其次,我们实现了 4K 分辨率的肖像视频生成。为此,我们对潜在代码进行向量量化,并应用时间对齐技术以维持时序维度上的一致性。通过集成高质量解码器,我们实现了 4K 分辨率的视觉合成。此外,我们将可调语义文本标签纳入肖像表情作为条件输入。这超越了传统的音频线索,提高了可控性并增加了生成内容的多样性。据我们所知,本文提出的 Hallo2 是首个实现 4K 分辨率并生成数小时音频驱动肖像图像动画,并支持文本提示的 метод。我们在公开数据集上进行了大量实验,包括 HDTF、CelebV 以及我们引入的“Wild”数据集。实验结果表明,我们的方法在长时长肖像视频动画中实现了状态-of-the-art 性能,成功生成持续可达数十分钟的富有可控性的 4K 分辨率内容。项目页面 https://fudan-generative-vision.github.io/hallo2
引用
@article{arxiv.2410.07718,
title = {Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation},
author = {Jiahao Cui and Hui Li and Yao Yao and Hao Zhu and Hanlin Shang and Kaihui Cheng and Hang Zhou and Siyu Zhu and Jingdong Wang},
journal= {arXiv preprint arXiv:2410.07718},
year = {2024}
}