中文

StyleSync:基于风格生成器的高保真通用与个性化唇形同步

计算机视觉与模式识别 2023-05-10 v1 图形学 多媒体

摘要

尽管近期在将唇部运动与任意声波同步方面取得了进展,当前方法仍难以平衡生成质量与模型泛化能力。先前研究要么需要长期数据训练,要么在所有主体上产生低质量的相似运动模式。在本文中,我们提出 StyleSync,一种实现高保真唇形同步的有效框架。我们确认基于风格的生成器将充分地在单样本和少样本场景下启用这一引人注目的特性。具体而言,我们设计了一个掩码引导的空间信息编码模块以保留给定人脸的细节。嘴形通过调制卷积由音频精确修改。此外,我们的设计还通过引入风格空间以及仅在有限帧上的生成器精修来实现个性化唇形同步。从而目标人物的身份与说话风格可被准确保留。大量实验证明了我们的方法在多种场景上生成高保真结果的有效性。资源可在 https://hangz-nju-cuhk.github.io/projects/StyleSync 找到。

关键词

引用

@article{arxiv.2305.05445,
  title  = {StyleSync: High-Fidelity Generalized and Personalized Lip Sync in Style-based Generator},
  author = {Jiazhi Guan and Zhanwang Zhang and Hang Zhou and Tianshu Hu and Kaisiyuan Wang and Dongliang He and Haocheng Feng and Jingtuo Liu and Errui Ding and Ziwei Liu and Jingdong Wang},
  journal= {arXiv preprint arXiv:2305.05445},
  year   = {2023}
}

备注

Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023. Project page: https://hangz-nju-cuhk.github.io/projects/StyleSync