中文

基于奖励引导优化的身份保持图像到视频生成

计算机视觉与模式识别 2026-03-31 v4

摘要

近期的图像到视频(I2V)生成技术在合成高质量、时序一致的视频方面取得了显著进展。其中,人物导向的视频生成占据了很大比例。然而,现有的I2V模型在保持输入人物图像与生成视频之间的身份一致性方面存在挑战,尤其是在人物面部表情变化大、动作频繁时。当人物面部在图像中占比很小时,这一问题更为严峻。由于人类对身份变化极为敏感,这一问题在I2V生成中仍属亟待解决的关键挑战。本文提出了身份保持奖励引导优化(IPRO)方法,一种基于强化学习的新型视频扩散框架,用于增强身份保持。该方法无需引入额外模块或修改模型架构,即可通过面部身份评分器对扩散模型进行直接且有效的调优。在性能提升与加快收敛方面,本方法通过反向传播奖励信号至采样链的后期步骤,实现更丰富的梯度反馈。我们还提出了一种新颖的面部评分机制,将 ground-truth 视频中的面部视为面部特征池,提供多角度面部信息以增强泛化性。进一步引入 KL 散度正则化,以稳定训练并防止对奖励信号过拟合。在 Wan 2.2 I2V 模型及本实验室自主研发的 I2V 模型上进行大量实验表明,我们的方法有效。我们的项目与代码已公开:https://ipro-alimama.github.io/。

关键词

引用

@article{arxiv.2510.14255,
  title  = {Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization},
  author = {Liao Shen and Wentao Jiang and Yiran Zhu and Jiahe Li and Tiezheng Ge and Zhiguo Cao and Bo Zheng},
  journal= {arXiv preprint arXiv:2510.14255},
  year   = {2026}
}

备注

accepted by CVPR 2026