PersonalVideo:无动态和语义退化的高 ID 保真视频定制
计算机视觉与模式识别
2025-03-18 v2
摘要
当前文本到视频 (T2V) 生成在合成逼真的通用视频方面取得了显著进展,但在针对特定身份的人类视频生成方面仍鲜有探索。关键挑战在于,在身份注入后仍能持续保持高 ID 保真度,同时保持原有的运动动态和语义遵循能力。当前的视频身份定制方法主要依赖在文本到图像模型上重构给定身份图像,这种过程与 T2V 模型分布不一致,导致动态和语义退化。为解决此问题,我们提出了一种新框架,称为 ,其采用对合成视频的奖励监督,而非对图像的简单重构目标。具体而言,我们首先引入身份一致性奖励,以有效注入参考身份,无需出现调优-推理间隙。随后,我们提出一种新型语义一致性奖励,以对齐生成视频的语义分布与原始 T2V 模型,保留其在身份注入期间的动态和语义遵循能力。通过非重构奖励训练,我们进一步采用模拟提示增强以减少过拟合,通过在更多语义情境中监督生成结果,获得良好的鲁棒性,即使仅使用一个参考图像亦可实现。广泛的实验结果表明,我们的方法在保持原始 T2V 模型固有视频生成质量方面显著优于先前方法,同时实现了高身份忠实度。
引用
@article{arxiv.2411.17048,
title = {PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation},
author = {Hengjia Li and Haonan Qiu and Shiwei Zhang and Xiang Wang and Yujie Wei and Zekun Li and Yingya Zhang and Boxi Wu and Deng Cai},
journal= {arXiv preprint arXiv:2411.17048},
year = {2025}
}