SegTalker:基于分割与掩码引导局部编辑的说话人脸生成
计算机视觉与模式识别
2024-09-06 v1 多媒体
摘要
音频驱动的说话人脸生成旨在合成唇部运动与输入音频同步的视频。然而,当前的生成技术在保留精细区域纹理(如皮肤、牙齿)方面面临挑战。为了解决上述挑战,我们提出了一种名为 SegTalker 的新框架,通过引入分割作为中间表示来解耦唇部运动与图像纹理。具体而言,给定解析网络所使用的图像掩码,我们首先利用语音驱动掩码并生成说话分割图。然后,我们使用掩码引导编码器将图像的语义区域解耦为风格编码。最后,我们将先前生成的说话分割图与风格编码注入掩码引导的 StyleGAN 以合成视频帧。通过这种方式,大部分纹理得以完整保留。此外,我们的方法能够固有地实现背景分离,并促进掩码引导的面部局部编辑。特别地,通过编辑掩码并从给定的参考图像中交换区域纹理(如头发、嘴唇、眉毛),我们的方法能够在生成说话人脸视频时实现无缝的面部编辑。实验表明,我们提出的方法能够有效保留纹理细节并生成时间一致的视频,同时在唇部同步方面保持竞争力。在 HDTF 和 MEAD 数据集上的定量与定性结果证明了我们的方法优于现有方法。
引用
@article{arxiv.2409.03605,
title = {SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing},
author = {Lingyu Xiong and Xize Cheng and Jintao Tan and Xianjia Wu and Xiandong Li and Lei Zhu and Fei Ma and Minglei Li and Huang Xu and Zhihu Hu},
journal= {arXiv preprint arXiv:2409.03605},
year = {2024}
}
备注
10 pages, 7 figures, 3 tables