中文

基于LCVD的高保真可重光单张人像动画

计算机视觉与模式识别 2025-03-03 v1

摘要

可重光人像动画旨在将静态参考人像动画化,以匹配驱动视频中头部运动和表情,同时适应用户指定或参考的光照条件。现有人像动画方法无法实现可重光人像,因为它们未区分并操控内在(身份和外观)与外在(姿态和光照)特征。本文提出Lighting Controllable Video Diffusion模型(LCVD),实现高保真、可重光人像动画。通过在预训练图像到视频扩散模型的特征空间中区分这些特征类型来解决此限制。具体而言,我们利用人像的3D网格、姿态和光照渲染阴影提示来表示外在属性,而参考图像则表示内在属性。在训练阶段,我们采用参考适配器将参考图像映射到内在特征子空间,同时采用阴影适配器将阴影提示映射到外在特征子空间。通过合并这些子空间的特征,模型实现了对生成动画中光照、姿态和表情的细粒度控制。广泛的评估表明,LCVD在光照真实性、图像质量和视频一致性方面优于最新方法,为可重光人像动画树立了新标杆。

关键词

引用

@article{arxiv.2502.19894,
  title  = {High-Fidelity Relightable Monocular Portrait Animation with Lighting-Controllable Video Diffusion Model},
  author = {Mingtao Guo and Guanyu Xing and Yanli Liu},
  journal= {arXiv preprint arXiv:2502.19894},
  year   = {2025}
}