中文

用于少样本说话头合成的学习型空间表征

计算机视觉与模式识别 2021-04-30 v1

摘要

我们提出一种用于少样本说话头合成的新方法。尽管神经说话头近期工作已取得有前景的结果,它们仍可能生成无法保持源图像中主体身份的图像。我们认为这是由于将每个主体在单一潜码中纠缠表征,该潜码建模了 3D 形状信息、身份线索、颜色、光照甚至背景细节。相反,我们提出将主体的表征分解为其空间与风格分量。我们的方法分两步生成目标帧。首先,它预测目标图像的稠密空间布局。其次,图像生成器利用所预测的布局进行空间去归一化并合成目标帧。我们通过实验表明,这种解耦表征在定量与定性上均显著优于以往方法。

关键词

引用

@article{arxiv.2104.14557,
  title  = {Learned Spatial Representations for Few-shot Talking-Head Synthesis},
  author = {Moustafa Meshry and Saksham Suri and Larry S. Davis and Abhinav Shrivastava},
  journal= {arXiv preprint arXiv:2104.14557},
  year   = {2021}
}

备注

http://www.cs.umd.edu/~mmeshry/projects/lsr/