中文

StyleLipSync:基于风格的个性化唇形同步视频生成

计算机视觉与模式识别 2024-02-13 v2 人工智能 机器学习

摘要

在本文中,我们提出 StyleLipSync,一种基于风格的个性化唇形同步视频生成模型,该模型可从任意音频生成与身份无关的唇形同步视频。为生成任意身份的视频,我们利用预训练 StyleGAN 语义丰富潜空间中的富有表现力的唇部先验,其中我们还可通过线性变换设计视频一致性。与先前的唇形同步方法相比,我们引入姿态感知掩码,通过逐帧利用 3D 参数化网格预测器动态定位掩码,以提升跨帧的自然度。此外,我们提出一种针对任意人物的少样本唇形同步适配方法,通过引入同步正则化器在保留唇形同步泛化能力的同时增强人物特定视觉信息。大量实验表明,我们的模型即使在零样本设定下也能生成准确的唇形同步视频,并可通过所提适配方法利用数秒目标视频增强未见人脸的特征。

关键词

引用

@article{arxiv.2305.00521,
  title  = {StyleLipSync: Style-based Personalized Lip-sync Video Generation},
  author = {Taekyung Ki and Dongchan Min},
  journal= {arXiv preprint arXiv:2305.00521},
  year   = {2024}
}

备注

International Conference on Computer Vision (ICCV) 2023. Project page: https://stylelipsync.github.io