中文

LivePortrait:基于拼接与重目标控制的高效肖像动画

计算机视觉与模式识别 2025-03-03 v2

摘要

肖像动画旨在从单张源图像生成逼真的视频,利用其作为外观参考,motion(即面部表情和头部姿态)来自驱动视频、音频、文本或生成。我们不跟随主流的基于扩散的方法,而是探索并扩展了隐式关键点框架的潜力,该框架有效地平衡了计算效率和可控性。基于此,我们开发了一个面向实际应用的视频驱动肖像动画框架,名为 LivePortrait,关注更好的泛化、可控性和效率。为增强生成质量和泛化能力,我们将训练数据规模扩大到约 6900 万高质量帧,采用混合图像-视频训练策略,升级网络架构,设计更好的运动转换和优化目标。此外,我们发现紧凑的隐式关键点可以有效表示一种混合形状,并仔细提出了拼接和两个重目标模块,这些模块利用一个小型 MLP 几乎没有计算开销,以增强可控性。实验结果表明,我们的框架即使与基于扩散的方法相比较,也有效。生成速度在 RTX 4090 GPU 上仅为 12.8ms。推理代码和模型可在 https://github.com/KwaiVGI/LivePortrait 获取。

关键词

引用

@article{arxiv.2407.03168,
  title  = {LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control},
  author = {Jianzhu Guo and Dingyun Zhang and Xiaoqiang Liu and Zhizhou Zhong and Yuan Zhang and Pengfei Wan and Di Zhang},
  journal= {arXiv preprint arXiv:2407.03168},
  year   = {2025}
}