中文

面向单样本说话人视频生成的自适应超分辨率方法

计算机视觉与模式识别 2024-03-26 v1 人工智能 图像与视频处理

摘要

单样本说话人视频生成旨在利用一张源肖像图像,在相同或不同身份视频的驱动下合成一段说话人视频。通常,这些方法需要通过雅可比矩阵进行基于平面的像素变换,或通过面部图像扭曲来生成新姿态。使用单张图像源和像素位移的约束往往会损害合成图像的清晰度。一些方法尝试通过引入额外的超分辨率模块来提高合成视频的质量,但这无疑会增加计算消耗并破坏原始数据分布。在这项工作中,我们提出了一种自适应的高质量说话人视频生成方法,无需额外的预训练模块即可合成高分辨率视频。具体而言,受现有超分辨率方法的启发,我们对单样本源图像进行下采样,然后通过编码器-解码器模块自适应地重建高频细节,从而增强视频清晰度。我们的方法通过一种简单而有效的策略,持续提升了生成视频的质量,并通过定量和定性评估得到了证实。代码和演示视频可在以下链接获取:\url{https://github.com/Songluchuan/AdaSR-TalkingHead/}。

关键词

引用

@article{arxiv.2403.15944,
  title  = {Adaptive Super Resolution For One-Shot Talking-Head Generation},
  author = {Luchuan Song and Pinxin Liu and Guojun Yin and Chenliang Xu},
  journal= {arXiv preprint arXiv:2403.15944},
  year   = {2024}
}

备注

5 pages, 3 figures