中文

基于语音唇读损失频率监督与跨模态支持的音视频视频人脸超分辨率

计算机视觉与模式识别 2022-11-22 v1

摘要

近来,人脸超分辨率任务取得诸多突破。然而,相较于图像,该任务在视频中因固有的一致性难题而更具挑战。视频人脸超分辨率中额外时间维度的存在,使得学习整个序列中的面部运动变得非平凡。为学习这些精细的时空运动细节,我们提出一种新颖的跨模态音视频视频人脸超分辨率生成对抗网络(VFH-GAN)。该架构利用了面部结构运动与相应语音信号之间的语义相关性。现有基于视频的方法另一主要问题是在嘴和唇等关键面部区域周围存在模糊——这些区域的空间位移远高于其他区域。所提方法显式定义唇读损失以学习这些面部区域的精细运动。训练期间,GAN有可能拟合从低频到高频的频率,从而导致遗漏难以合成的频率。因此,为向网络添加显著频率特征,我们加入基于频率的损失函数。与最先进方法的可视化与量化对比显示了性能与效能的显著提升。

关键词

引用

@article{arxiv.2211.10883,
  title  = {Audio-visual video face hallucination with frequency supervision and cross modality support by speech based lip reading loss},
  author = {Shailza Sharma and Abhinav Dhall and Vinay Kumar and Vivek Singh Bawa},
  journal= {arXiv preprint arXiv:2211.10883},
  year   = {2022}
}