G4G:一种面向高保真说话人脸生成的通用框架,具有细粒度模态内对齐
计算机视觉与模式识别
2024-03-05 v2 多媒体
摘要
尽管已有大量研究,但实现与任意音频高度同步的唇部运动的高保真说话人脸生成仍然是该领域的一项重大挑战。已发表研究的不足继续困扰着许多研究者。本文介绍了G4G,一种面向高保真说话人脸生成的通用框架,具有细粒度模态内对齐。G4G能够重现原始视频的高保真度,同时产生高度同步的唇部运动,无论给定的音频音调或音量如何。G4G成功的关键在于使用对角矩阵增强音频-图像模态内特征的普通对齐,这显著增加了正负样本之间的对比学习。此外,引入了一个多尺度监督模块,以全面重现原始视频在面部区域上的感知保真度,同时强调唇部运动与输入音频的同步。然后使用融合网络进一步融合面部区域和其余部分。我们的实验结果表明,在重现原始视频质量以及高度同步的说话嘴唇方面取得了显著成就。G4G是一个性能优越的通用框架,能够生成与当前最先进方法相比更接近真实水平的说话视频。
引用
@article{arxiv.2402.18122,
title = {G4G:A Generic Framework for High Fidelity Talking Face Generation with Fine-grained Intra-modal Alignment},
author = {Juan Zhang and Jiahao Chen and Cheng Wang and Zhiwang Yu and Tangquan Qi and Di Wu},
journal= {arXiv preprint arXiv:2402.18122},
year = {2024}
}