Magic-Me:特定身份的视频定制扩散
计算机视觉与模式识别
2024-03-21 v2 人工智能
摘要
生成具有指定身份 (ID) 的内容在生成模型领域引起了极大兴趣。在文本到图像生成 (T2I) 领域,通过参考图像控制身份的主题驱动创作已取得重大进展。然而,其在视频生成中的扩展尚未得到充分探索。在本工作中,我们提出了一种简单而有效的主题身份可控视频生成框架,称为视频定制扩散 (Video Custom Diffusion, VCD)。VCD 利用由少量图像定义的指定身份,在初始化阶段强化身份特征并注入帧间相关性,以生成稳定的视频输出。为此,我们提出了三个对高质量身份保持和稳定视频生成至关重要的新颖组件:1) 一种具有 3D 高斯噪声先验的噪声初始化方法,以实现更好的帧间稳定性;2) 一个基于扩展文本反转 (Textual Inversion) 的 ID 模块,使用裁剪后的身份进行训练,以将 ID 信息与背景解耦;3) 面部 VCD 和平铺 VCD 模块,用于强化面部特征并将视频 upscale 至更高分辨率,同时保留身份特征。我们进行了大量实验,验证了 VCD 能够生成比基线更稳定且身份保持更好的视频。此外,凭借 ID 模块中编码身份的可迁移性,VCD 也能与公开可用的个性化文本到图像模型良好配合。代码地址:https://github.com/Zhen-Dong/Magic-Me。
引用
@article{arxiv.2402.09368,
title = {Magic-Me: Identity-Specific Video Customized Diffusion},
author = {Ze Ma and Daquan Zhou and Chun-Hsiao Yeh and Xue-She Wang and Xiuyu Li and Huanrui Yang and Zhen Dong and Kurt Keutzer and Jiashi Feng},
journal= {arXiv preprint arXiv:2402.09368},
year = {2024}
}
备注
Project Page at https://magic-me-webpage.github.io