中文

InfinityHuman: 面向长期音频驱动的人类

计算机视觉与模式识别 2025-08-29 v1

摘要

音频驱动的人类动画因其实际应用而引起广泛关注。然而,在生成具有一致外观和自然手部运动的高分辨率、长时程视频方面仍存在关键挑战。现有方法通过重叠运动帧扩展视频,但 suffer from error accumulation,导致身份漂移、颜色偏移和场景不稳定。此外,手部运动建模不足,导致明显的变形和与音频的错位。在本工作中,我们提出了InfinityHuman,一个粗到细的框架,首先生成音频同步表示,然后通过姿态引导的细化器逐步细化为高分辨率、持久的视频。由于姿态序列与外观解耦且抗于时间退化,我们的姿态引导细化器采用稳定姿态和初始帧作为视觉锚点,以减少漂移并提高唇部同步。此外,为增强语义准确性和手势逼真度,我们引入了一个针对高质量手部运动数据训练的手部特定奖励机制。在EMTD和HDTF数据集上的实验表明,InfinityHuman在视频质量、身份保持、手部精度和唇部同步方面实现了最佳性能。消融研究进一步确认了每个模块的有效性。代码将公开提供。

关键词

引用

@article{arxiv.2508.20210,
  title  = {InfinityHuman: Towards Long-Term Audio-Driven Human},
  author = {Xiaodi Li and Pan Xie and Yi Ren and Qijun Gan and Chen Zhang and Fangyuan Kong and Xiang Yin and Bingyue Peng and Zehuan Yuan},
  journal= {arXiv preprint arXiv:2508.20210},
  year   = {2025}
}

备注

Project Page: https://infinityhuman.github.io/