说话人脸视频中可连续控制的面部表情编辑
计算机视觉与模式识别
2023-11-29 v2 图形学
摘要
近年来,音频驱动的说话人脸视频生成引起了相当关注。然而,极少有研究解决这类说话人脸视频中具备连续可控表情的情感编辑问题,而这是工业界的强烈需求。其挑战在于,与语音相关的表情和与情感相关的表情往往高度耦合。同时,传统的图像到图像翻译方法因表情与姿态等其他属性的耦合(例如由于训练数据分布偏差,逐帧转换角色表情可能同时改变头部姿态),无法在我们的应用中良好工作。本文提出一种面向说话人脸视频的高质量面部表情编辑方法,允许用户连续控制编辑后视频中的目标情感。我们将该任务视为运动信息编辑的一种特例,使用 3DMM 捕捉主要面部运动,并用 StyleGAN 建模的关联纹理图捕捉外观细节。两种表征(3DMM 与纹理图)均包含情感信息,可由神经网络连续修改,并易于在系数/潜空间内通过平均平滑,使方法简洁而有效。我们还引入嘴形保持损失以控制唇形同步与编辑表情夸张程度之间的权衡。大量实验与用户研究表明,我们的方法在各评价指标上均达到 SOTA 性能。
引用
@article{arxiv.2209.08289,
title = {Continuously Controllable Facial Expression Editing in Talking Face Videos},
author = {Zhiyao Sun and Yu-Hui Wen and Tian Lv and Yanan Sun and Ziyang Zhang and Yaoyuan Wang and Yong-Jin Liu},
journal= {arXiv preprint arXiv:2209.08289},
year = {2023}
}
备注
Accepted by IEEE Transactions on Affective Computing (DOI: 10.1109/TAFFC.2023.3334511). Demo video: https://youtu.be/WD-bNVya6kM . Project page: https://raineggplant.github.io/FEE4TV