DPE:用于通用视频人像编辑的姿态与表情解耦方法
计算机视觉与模式识别
2023-03-03 v2
摘要
单次视频驱动的说话人脸生成旨在通过将面部运动从一段视频迁移到任意人像图像来生成合成说话视频。头部姿态与面部表情在面部运动中总是纠缠在一起并同时被迁移。然而,这种纠缠为这些方法直接用于视频人像编辑设置了障碍,因为后者可能需要在保持姿态不变的情况下仅修改表情。解耦姿态与表情的一个挑战是缺乏配对数据,例如相同姿态但不同表情的数据。仅有少数方法尝试借助 3D 可变形模型(3DMMs)进行显式解耦来应对这一挑战。但由于 Blendshape 数量有限,3DMMs 不足以捕捉面部细节,这对运动迁移有副作用。本文引入一种新颖的自监督解耦框架,在无 3DMMs 且无配对数据的情况下解耦姿态与表情,该框架由运动编辑模块、姿态生成器和表情生成器组成。编辑模块将人脸投影到潜空间中,其中姿态运动与表情运动可解耦,并可通过相加在潜空间中方便地执行姿态或表情迁移。两个生成器分别将修改后的潜码渲染为图像。此外,为保证解耦,我们提出了一种带有精心设计的约束的双向循环训练策略。评估表明,我们的方法可独立控制姿态或表情,并可用于通用视频编辑。
引用
@article{arxiv.2301.06281,
title = {DPE: Disentanglement of Pose and Expression for General Video Portrait Editing},
author = {Youxin Pang and Yong Zhang and Weize Quan and Yanbo Fan and Xiaodong Cun and Ying Shan and Dong-ming Yan},
journal= {arXiv preprint arXiv:2301.06281},
year = {2023}
}
备注
https://carlyx.github.io/DPE/