中文

面向说话头视频生成的在线尺度变换学习

计算机视觉与模式识别 2024-07-16 v1 人工智能

摘要

单次说话头视频生成使用源图像和驱动视频创建合成视频,其中源图像中人物的面部运动模仿驱动视频中的面部运动。然而,源图像与驱动图像之间的尺度差异仍是面部重构的一个挑战。现有方法尝试定位与源图像最佳对齐的驱动视频帧,但对齐不准确可能导致次优结果。为此,我们引入一个尺度变换模块,可自动调整驱动图像的尺度以适配源图像的尺度,利用源图像和驱动帧中检测到的关键点所维护的尺度差异信息。此外,为在生成过程中持续感知尺度信息,我们将来自尺度变换模块所学习的尺度信息整合到生成过程的每一层,以产生准确尺度的最终结果。我们的 метод能够通过所提出的在线尺度变换面部重构网络,在无需任何锚框的情况下实现两图像之间精确的运动迁移。大量实验表明,我们的方法可根据源面部自动调整驱动面部的尺度,并在跨身份证面部重构中生成具有准确尺度的高质量面部。

关键词

引用

@article{arxiv.2407.09965,
  title  = {Learning Online Scale Transformation for Talking Head Video Generation},
  author = {Fa-Ting Hong and Dan Xu},
  journal= {arXiv preprint arXiv:2407.09965},
  year   = {2024}
}