Identity-GRPO:通过强化学习优化多人物身份保持的视频生成
计算机视觉与模式识别
2026-02-02 v3
摘要
尽管像VACE和Phantom这样的先进方法在多样化场景中推进了特定主体的视频生成,但它们在动态交互中的多人物身份保持方面仍面临挑战,而在多个角色之间保持一致的身份至关重要。为了解决这个问题,我们提出了Identity-GRPO,一种用于优化多人物身份保持视频生成的人类反馈驱动优化流程。首先,我们构建了一个视频奖励模型,该模型在一个包含人工标注和合成失真数据的大规模偏好数据集上进行训练,其成对标注专注于在整个视频中保持人物一致性。然后,我们采用了一种针对多人物一致性定制的GRPO变体,该变体极大地增强了VACE和Phantom。通过广泛的消融研究,我们评估了标注质量和设计选择对策略优化的影响。实验表明,与基线方法相比,Identity-GRPO在人物一致性指标上实现了高达18.9%的提升,为将强化学习与个性化视频生成相结合提供了可行的见解。
引用
@article{arxiv.2510.14256,
title = {Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning},
author = {Xiangyu Meng and Zixian Zhang and Zhenghao Zhang and Junchao Liao and Long Qin and Weizhi Wang},
journal= {arXiv preprint arXiv:2510.14256},
year = {2026}
}
备注
Our project and code are available at https://ali-videoai.github.io/identity_page, https://github.com/alibaba/identity-grpo