LiP-Flow:通过潜空间归一化流学习编解码器虚拟形象的推理时先验
计算机视觉与模式识别
2022-03-16 v1
摘要
从相机穹顶捕获的多视角数据训练出的神经人脸虚拟形象可生成照片级真实的 3D 重建。然而在推理时,它们必须由有限输入驱动,例如头显挂载相机记录的局部视角或前置相机,以及稀疏面部 landmarks。为缓解这种不对称,我们引入一个以运行时输入为条件的先验模型,并通过潜空间中的归一化流将该先验空间与 3D 人脸模型绑定。我们提出的模型 LiP-Flow 由两个编码器组成,分别从丰富的训练时观测与匮乏的推理时观测中学习表示。一个归一化流桥接两个表示空间并将潜样本从一域变换至另一域,使我们能够定义潜似然目标。我们端到端训练模型以最大化两表示空间的相似度与重建质量,使 3D 人脸模型感知有限的驱动信号。我们进行了大量评估,其中潜码被优化以从局部或稀疏观测重建 3D 虚拟形象。我们表明我们的方法带来了具表现力且有效的先验,能更好地捕捉面部动态与细微表情。
引用
@article{arxiv.2203.07881,
title = {LiP-Flow: Learning Inference-time Priors for Codec Avatars via Normalizing Flows in Latent Space},
author = {Emre Aksan and Shugao Ma and Akin Caliskan and Stanislav Pidhorskyi and Alexander Richard and Shih-En Wei and Jason Saragih and Otmar Hilliges},
journal= {arXiv preprint arXiv:2203.07881},
year = {2022}
}