中文

AlignHuman:基于时间步分段偏好优化提升运动与保真度的人类动画

计算机视觉与模式识别 2025-06-16 v1

摘要

近期 diffusion 模型驱动的人类视频生成和动画任务取得了显著进展。然而,由于运动自然性与视觉保真度之间的权衡,具有表现力和真实感的人类动画仍然具有挑战性。为此,我们提出了 AlignHuman 框架,将偏好优化作为后训练技术结合分层训练策略,以联合优化这两个竞争目标。我们的关键洞察源于对不同时间步去噪过程的分析:(1) 早期去噪时间步主要控制运动动力学,而 (2) 后期时间步可有效管理保真度和人体结构,即使跳过早期步骤。基于此观察,我们提出了时间步分段偏好优化 (TPO) 方法,并引入两个专门的 LoRAs 作为专家对齐模块,分别针对其对应时间区间中的特定维度进行优化。这些 LoRAs 根据各自的偏好数据进行训练,在推理时根据对应区间激活,以提升运动自然性和保真度。广泛的实验表明,AlignHuman 在强大基线上进行改进,推理时减少 NFEs,实现了 3.3 倍加速(从 100 个 NFEs 提升至 30 个 NFEs),同时对生成质量几乎没有影响。主页:https://alignhuman.github.io/

关键词

引用

@article{arxiv.2506.11144,
  title  = {AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation},
  author = {Chao Liang and Jianwen Jiang and Wang Liao and Jiaqi Yang and Zerong zheng and Weihong Zeng and Han Liang},
  journal= {arXiv preprint arXiv:2506.11144},
  year   = {2025}
}

备注

Homepage: https://alignhuman.github.io/