中文

HDTR-Net:一种面向任意说话人脸生成方法的高清牙齿修复实时网络

计算机视觉与模式识别 2023-09-15 v1 人工智能

摘要

说话人脸生成(TFG)旨在从具有潜在关联的音频和面部特征中重建面部运动以实现高自然度的唇部运动。现有 TFG 方法已取得显著进展,可生成自然真实的图像。然而,大多数工作很少考虑视觉质量。在跨模态生成方法中,保证唇形同步同时避免视觉质量下降具有挑战性。为解决此问题,我们提出了一种通用的高清牙齿修复网络,称为 HDTR-Net,适用于任意 TFG 方法。HDTR-Net 能以极快速度增强牙齿区域,同时保持同步性和时间一致性。特别地,我们提出细粒度特征融合(FGFF)模块,有效捕获牙齿及周围区域的精细纹理特征信息,并利用这些特征细化特征图以提升牙齿清晰度。大量实验表明,我们的方法可适配任意 TFG 方法,且不损害唇形同步与帧连贯性。HDTR-Net 的另一优势是其实时生成能力。在说话人脸视频合成的高清修复条件下,其推理速度比当前基于超分辨率的 SOTA 人脸修复方法快 300%300\%

关键词

引用

@article{arxiv.2309.07495,
  title  = {HDTR-Net: A Real-Time High-Definition Teeth Restoration Network for Arbitrary Talking Face Generation Methods},
  author = {Yongyuan Li and Xiuyuan Qin and Chao Liang and Mingqiang Wei},
  journal= {arXiv preprint arXiv:2309.07495},
  year   = {2023}
}

备注

15pages, 6 figures, PRCV2023