中文

学习用耳朵进行人脸超分辨率重建

计算机视觉与模式识别 2020-04-03 v3 音频与语音处理 图像与视频处理

摘要

我们提出一种新方法,利用音频和低分辨率图像来执行极端人脸超分辨率(输入尺寸增大 16 倍)。当输入图像分辨率非常低(例如 8x8 像素)时,信息丢失极为严重,原始身份的重要细节已丧失,而音频可辅助恢复合理的高分辨率图像。事实上,音频携带有关面部属性(如性别和年龄)的信息。为结合听觉与视觉模态,我们提出一种方法,首先由单独音频轨构建人脸的潜在表示,然后由单独低分辨率图像构建。随后我们训练网络融合这两种表示。我们通过实验表明,音频可辅助恢复性别、年龄和身份等属性,从而改善高分辨率图像重建过程的正确性。我们的过程不使用人工标注,因此可利用现有视频数据集轻松训练。此外,我们表明我们的模型构建了图像与音频的分解表示,因为它允许混合来自不同视频的低分辨率图像和音频,并生成具有语义有意义组合的逼真人脸。

关键词

引用

@article{arxiv.1909.12780,
  title  = {Learning to Have an Ear for Face Super-Resolution},
  author = {Givi Meishvili and Simon Jenni and Paolo Favaro},
  journal= {arXiv preprint arXiv:1909.12780},
  year   = {2020}
}