中文

LIA-X:可解释潜在肖像动画器

计算机视觉与模式识别 2025-08-14 v1

摘要

我们介绍 LIA-X,一种新型可解释肖像动画器,旨在将驾驶视频中的面部动力学传递到源肖像,并具备细粒度控制。LIA-X 是一种自编码器,將动力学传递建模为潜在空间中动力学代码的线性导航。关键的是,它包含一种新型稀疏运动词典(Sparse Motion Dictionary),使模型能够将面部动力学解耦为可解释因素。偏离之前的“warp-render”方法,稀疏运动词典的可解释性使 LIA-X 能够支持高度可控的“edit-warp-render”策略,使其能够精确操控源肖像中的细粒度面部语义。这有助于缩小驾驶视频在姿态和表情方面的初始差异。此外,我们展示了 LIA-X 的可扩展性,通过成功在大型数据集上训练约 10 亿参数的大规模模型。实验结果表明,我们提出的方法在多个基准测试中在自我重生与跨重生任务中均优于先前方法。此外,LIA-X 的可解释性和可控性支持实际应用,如细粒度用户导向的图像和视频编辑,以及 3D aware 肖像视频操控。

关键词

引用

@article{arxiv.2508.09959,
  title  = {LIA-X: Interpretable Latent Portrait Animator},
  author = {Yaohui Wang and Di Yang and Xinyuan Chen and Francois Bremond and Yu Qiao and Antitza Dantcheva},
  journal= {arXiv preprint arXiv:2508.09959},
  year   = {2025}
}

备注

Project Page: https://wyhsirius.github.io/LIA-X-project/