中文

通过语义表示对齐提升人类图像动画

计算机视觉与模式识别 2026-05-12 v1

摘要

图像到视频生成领域取得了显著进展。然而,尤其是在生成长视频或建模复杂运动时,仍存在人类肢体扭曲和面部变形等挑战。现有的人类图像动画方法通过融合人类专用语义表示(如稠密姿态或身份嵌入)作为额外条件来解决这些问题。然而,仅凭这些表示进行条件控制可能会降低生成的灵活性。此外,这些方法依赖RGB像素监督,缺乏对学习必要3D几何关系和时间一致性的关注。相反,我们引入一种新方法,称为SemanticREPA,通过表示对齐将这些语义表示用作监督信号。具体而言,我们首先训练结构对齐模块,将从视频潜在表示中获得的结构表示与视频深度估计特征对齐。我们冻结预训练模块,并利用它为扩散模型的结构表示提供额外监督,以实现结构校正,生成连贯稳定的人类结构。同时,我们开发了身份对齐模块,将生成视频的身份表示与面部识别特征对齐。我们进一步提出使用预测的结构表示来细化相关区域的身份恢复。在结构和身份对齐的共同作用下,我们的方法在扩展人物动作和增强人物一致性方面表现出优异的性能。

关键词

引用

@article{arxiv.2605.10523,
  title  = {Improving Human Image Animation via Semantic Representation Alignment},
  author = {Chang Liu and Mengting Chen and Yixuan Huang and Haoning Wu and Chen Ju and Shuai Xiao and Jinsong Lan and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2605.10523},
  year   = {2026}
}

备注

Accepted by CVPR 2026 workshop