DINet:用于高分辨率视频中逼真人脸视觉配音的形变修复网络
计算机视觉与模式识别
2023-03-08 v1
摘要
对于少样本学习,在高分辨率视频上实现照片级逼真的人脸视觉配音仍是一项关键挑战。先前的工作未能生成高保真配音结果。为解决上述问题,本文提出一种用于高分辨率人脸视觉配音的形变修复网络(DINet)。与依赖多个上采样层从潜在嵌入直接生成像素的先前工作不同,DINet对参考图像的特征图进行空间形变,以更好地保留高频纹理细节。具体而言,DINet由一个形变部分和一个修复部分组成。在第一部分中,五张参考人脸图像自适应地执行空间形变,以创建在每一帧编码嘴型的形变特征图,从而与输入驱动音频以及输入源图像的头部位姿对齐。在第二部分中,为产生人脸视觉配音,一个特征解码器负责将形变特征图中的嘴部运动与源特征图中的其他属性(即头部位姿和上半脸表情)自适应地结合在一起。最终,DINet生成具有丰富纹理细节的人脸视觉配音。我们进行定性和定量比较,以在高分辨率视频上验证我们的DINet。实验结果表明,我们的方法优于最先进的工作。
引用
@article{arxiv.2303.03988,
title = {DINet: Deformation Inpainting Network for Realistic Face Visually Dubbing on High Resolution Video},
author = {Zhimeng Zhang and Zhipeng Hu and Wenjin Deng and Changjie Fan and Tangjie Lv and Yu Ding},
journal= {arXiv preprint arXiv:2303.03988},
year = {2023}
}
备注
AAAI-23, 9pages