面向细粒度可控说话头合成的解耦表示渐进学习
计算机视觉与模式识别
2022-11-29 v1
摘要
我们提出了一种新颖的一次性说话头合成方法,可实现对唇部运动、目光与眨眼、头部姿态以及情感表达的细粒度解耦控制。我们通过解耦的隐表示来表征不同运动,并利用图像生成器从中合成说话头。为有效解耦各运动因子,我们提出一种由粗到细的渐进解耦表示学习策略,即先从驱动信号中提取统一运动特征,再从统一特征中分离出各细粒度运动。针对非情感运动,我们引入运动特定的对比学习与回归;针对情感表达,我们采用特征级去相关与自重建,以充分利用非结构化视频数据中各运动因子的固有属性来实现解耦。实验表明,我们的方法能提供高质量的语音与唇动同步,并对多种额外面部运动实现精确且解耦的控制,这是以往方法难以实现的。
引用
@article{arxiv.2211.14506,
title = {Progressive Disentangled Representation Learning for Fine-Grained Controllable Talking Head Synthesis},
author = {Duomin Wang and Yu Deng and Zixin Yin and Heung-Yeung Shum and Baoyuan Wang},
journal= {arXiv preprint arXiv:2211.14506},
year = {2022}
}
备注
18 pages