中文

VividAnimator:一种端到端的音频和姿态驱动的半身人体动画框架

计算机视觉与模式识别 2025-10-14 v1

摘要

现有的音频和姿态驱动的人体动画方法常常面临头部运动僵硬和手部模糊的问题,这主要是由于音频与头部运动之间的弱相关性以及手部的结构复杂性所致。为了解决这些问题,我们提出VividAnimator,一个端到端的框架,用于生成由音频和稀疏手部姿态条件驱动的高质量半身人体动画。我们的框架引入了三项关键创新。首先,为了克服在线码本训练的不稳定性和高成本,我们预训练了一个手部清晰度码本(HCC),该码本编码了丰富、高保真的手部纹理先验,显著缓解了手部退化。其次,我们设计了一个双流音频感知模块(DSAA),分别对唇部同步和自然头部姿态动态进行建模,同时允许交互。第三,我们引入了一个姿态校准技巧(PCT),通过放松刚性约束来细化和对齐姿态条件,确保平滑自然的姿态过渡。大量实验表明,VividAnimator达到了最先进的性能,生成的视频具有卓越的手部细节、姿态真实感和身份一致性,这由定量指标和定性评估共同验证。

关键词

引用

@article{arxiv.2510.10269,
  title  = {VividAnimator: An End-to-End Audio and Pose-driven Half-Body Human Animation Framework},
  author = {Donglin Huang and Yongyuan Li and Tianhang Liu and Junming Huang and Xiaoda Yang and Chi Wang and Weiwei Xu},
  journal= {arXiv preprint arXiv:2510.10269},
  year   = {2025}
}

备注

Comments: 10 pages, 6 figures