中文

稳定视频肖像

计算机视觉与模式识别 2024-09-27 v1

摘要

生成式 AI 和文本到图像方法在快速进步,已彻底改变我们与计算机生成图像的交互方式和感知方式。与此同时,3D 人脸重建取得了显著进展,尤其是利用 3D Morphable Models(3DMM)。本文提出了 SVP(Stable Video Portraits),一种新型的混合 2D/3D 生成方法,输出基于大型预训练文本到图像先验(2D)的逼真讲话人视频,通过 3DMM(3D)进行控制。具体而言,我们对通用 2D 稳定扩散模型进行人物特定的微调,并通过提供时间序列 3DMM 序列作为条件并引入时间去噪程序,将其提升为视频模型。作为输出,该模型生成基于 3DMM 控制的、具有 3DMM 控制的、具有 3DMM 控制的人物特定头像。该人物特定头像的面部外观可在无需测试时进行编辑和变形为文本定义的名人。该方法经过定量和定性分析,显示其在单目头部头像方法方面优于现有技术。

关键词

引用

@article{arxiv.2409.18083,
  title  = {Stable Video Portraits},
  author = {Mirela Ostrek and Justus Thies},
  journal= {arXiv preprint arXiv:2409.18083},
  year   = {2024}
}

备注

Accepted at ECCV 2024, Project: https://svp.is.tue.mpg.de