基于音视觉先验的极端尺度说话人脸视频上采样
计算机视觉与模式识别
2022-08-18 v1
摘要
本文中,我们探究一个有趣的问题:从 像素视频序列中能获取什么。令人惊讶的是,结果相当丰富。我们展示,当以恰当的音频与图像先验处理该 视频时,可获得完整长度、 的视频。我们利用新颖的音视觉上采样网络实现了对极低分辨率输入如此 的缩放。音频先验有助于恢复基本面部细节与精确唇形,而单张高分辨率目标身份图像先验为我们提供了丰富的外观细节。我们的方法是一个端到端多阶段框架。第一阶段生成粗粒度中间输出视频,随后可用于驱动单张目标身份图像并生成逼真、准确且高质量的输出现频。我们的方法简洁,且相较先前超分辨率方法表现极为优异(FID 分数提升 )。我们还将模型扩展至说话人脸视频压缩,并展示在 bits/pixel 上相较先前 SOTA 取得 提升。网络结果通过大量消融实验(见正文与补充材料)被透彻分析。我们亦在网站提供演示视频及代码与模型:\url{http://cvit.iiit.ac.in/research/projects/cvit-projects/talking-face-video-upsampling}。
引用
@article{arxiv.2208.08118,
title = {Extreme-scale Talking-Face Video Upsampling with Audio-Visual Priors},
author = {Sindhu B Hegde and Rudrabha Mukhopadhyay and Vinay P Namboodiri and C. V. Jawahar},
journal= {arXiv preprint arXiv:2208.08118},
year = {2022}
}
备注
Accepted in ACM-MM 2022, 10 pages, 6 pages supplementary, 18 Figures