中文

ID-Animator:零样本身份保持的人体视频生成

计算机视觉与模式识别 2024-06-26 v3

摘要

生成具有指定身份的高保真人体视频在内容生成领域引起了广泛关注。然而,现有技术难以在训练效率和身份保持之间取得平衡,要么需要繁琐的逐案微调,要么在视频生成过程中通常会丢失身份细节。在本研究中,我们提出了 \textbf{ID-Animator},一种零样本人体视频生成方法,仅需单张参考面部图像即可进行个性化视频生成,无需进一步训练。ID-Animator 继承了现有的基于扩散模型的视频生成骨干网络,并配备了一个面部适配器,用于从可学习的人脸潜在查询中编码身份相关嵌入。为了促进视频生成中身份信息的提取,我们引入了一个面向身份的数据集构建流水线,该流水线结合了来自所构建面部图像池的统一人类属性和动作描述技术。基于此流水线,进一步设计了一种随机参考训练策略,通过身份保持损失精确捕获身份相关嵌入,从而提高了我们模型在特定身份视频生成中的保真度和泛化能力。大量实验证明了 ID-Animator 在生成个性化人体视频方面优于先前模型。此外,我们的方法与流行的预训练 T2V 模型(如 animatediff)以及各种社区骨干模型高度兼容,在高度期望保持身份的视频生成实际应用中展现出高可扩展性。我们的代码和检查点已发布于 https://github.com/ID-Animator/ID-Animator。

关键词

引用

@article{arxiv.2404.15275,
  title  = {ID-Animator: Zero-Shot Identity-Preserving Human Video Generation},
  author = {Xuanhua He and Quande Liu and Shengju Qian and Xin Wang and Tao Hu and Ke Cao and Keyu Yan and Jie Zhang},
  journal= {arXiv preprint arXiv:2404.15275},
  year   = {2024}
}

备注

Project Page: https://id-animator.github.io/