中文

DaGAN++:用于说话头视频生成的深度感知生成对抗网络

计算机视觉与模式识别 2023-12-12 v2 人工智能

摘要

说话头生成的主流技术很大程度上依赖于2D信息,包括来自输入人脸图像的面容外观与运动。然而,稠密3D面部几何(如逐像素深度)在构建精确3D面部结构以及抑制生成中复杂背景噪声方面起着关键作用。但是,面部视频的稠密3D标注获取成本极高。本工作中,我们首先提出一种自监督方法,从人脸视频中学习稠密3D面部几何(即深度),训练时无需相机参数与3D几何标注。我们进一步提出一种策略,学习像素级不确定性,以感知更可靠的刚体运动像素用于几何学习。其次,我们设计了一个有效的几何引导面部关键点估计模块,为生成运动场提供精确关键点。最后,我们开发了3D感知跨模态(即外观与深度)注意力机制,可应用于每一生成层,以由粗到细的方式捕捉面部几何。在三个具有挑战性的基准(即VoxCeleb1、VoxCeleb2与HDTF)上进行了充分实验。结果表明,我们提出的框架能生成高度逼真的重演说话视频,并在这些基准上确立了新的SOTA性能。代码与训练模型已公开于GitHub项目页:https://github.com/harlanhong/CVPR2022-DaGAN

关键词

引用

@article{arxiv.2305.06225,
  title  = {DaGAN++: Depth-Aware Generative Adversarial Network for Talking Head Video Generation},
  author = {Fa-Ting Hong and Li Shen and Dan Xu},
  journal= {arXiv preprint arXiv:2305.06225},
  year   = {2023}
}

备注

Accepted at TPAMI; CVPR 2022 extension