中文

基于教师-学生框架的优越且实用说话人脸生成

计算机视觉与模式识别 2024-03-27 v1

摘要

说话人脸生成技术从任意外观和运动信号创建说话视频,所谓“任意”提供了便捷性,但也带来了实际应用中的挑战。现有方法在标准输入下表现良好,但在复杂现实输入下会出现严重性能下降。此外,效率也是一个在部署中的重要关注点。为全面解决这些问题,我们提出了 SuperFace,一个在质量、鲁棒性、成本和可编辑性之间进行权衡的教师-学生框架。我们首先提出一种简单而有效的教师模型,能够处理各异质量的输入以生成高质量结果。基于此,我们设计了一种高效的蒸馏策略,以获取一个在计算负担显著降低的情况下仍保持质量的身份特定学生模型。我们的实验验证了 SuperFace 比现有方法为上述四个目标提供了更全面的解决方案,尤其在学生模型中将 FLOPs 降低了 99%。SuperFace 可由视频或音频驱动,并支持局部人脸属性编辑。

关键词

引用

@article{arxiv.2403.17883,
  title  = {Superior and Pragmatic Talking Face Generation with Teacher-Student Framework},
  author = {Chao Liang and Jianwen Jiang and Tianyun Zhong and Gaojie Lin and Zhengkun Rong and Jiaqi Yang and Yongming Zhu},
  journal= {arXiv preprint arXiv:2403.17883},
  year   = {2024}
}