中文

基于频率分解的身份保持文本到视频生成

计算机视觉与模式识别 2025-03-27 v3 多媒体

摘要

身份保持文本到视频(IPT2V)生成旨在创建具有一致人类身份的高保真视频。这一任务虽然重要,但至今仍是生成模型面临的开放问题。本文从两个尚未在文献中解决的方向推进 IPT2V 的技术前沿:(1) 无需繁琐案例逐一微调的调谐自由管线,(2) 基于频率分析的身份保持 DiT 风格控制方案。我们提出了 ConsisID,一个调谋自由的 DiT 风格可控 IPT2V 模型,以保持生成视频中的人类身份一致。灵感来源于脉冲扩散变换器的频率分析先行研究,本方法在频率域中采用身份控制信号,其中面部特征可分解为低频全局特征和高频内在特征。首先,从低频视角,我们引入全局面部提取器,将参考图像和面部关键点编码到潜在空间,生成包含低频信息丰富的特征。这些特征随后被整合到网络的浅层,以缓解 DiT 训练中的挑战。其次,从高频视角,我们设计局部面部提取器以捕获高频细节并注入变换器模块,从而增强模型保留细粒度特征的能力。我们提出了分层训练策略,利用频率信息实现身份保持,将一个普通的预训练视频生成模型转化为 IPT2V 模型。广泛的实验表明,我们的频率感知启发式方案为 DiT 风格模型提供了最佳控制解决方案。得益于此方案,ConsisID 生成高质量且身份保持的视频,为更有效的 IPT2V 迈出了重要一步。代码:https://github.com/PKU-YuanGroup/ConsisID。

关键词

引用

@article{arxiv.2411.17440,
  title  = {Identity-Preserving Text-to-Video Generation by Frequency Decomposition},
  author = {Shenghai Yuan and Jinfa Huang and Xianyi He and Yunyuan Ge and Yujun Shi and Liuhan Chen and Jiebo Luo and Li Yuan},
  journal= {arXiv preprint arXiv:2411.17440},
  year   = {2025}
}

备注

CVPR 2025