CPNet:利用基于 CLIP 的注意力浓缩器与概率图引导实现高保真说话人脸生成
多媒体
2023-05-24 v1 人工智能
计算机视觉与模式识别
摘要
近年来,由于说话人脸生成面临艰巨挑战且应用场景广泛(如电影动画与虚拟主播),其引起了计算机视觉研究界日益增长的关注。尽管已有不懈努力来提升生成说话人脸视频的保真度与唇形同步质量,但在合成质量与效率方面仍有较大改进空间。实际上,这些尝试在一定程度上忽视了对细粒度特征提取/整合的探索,以及 landmarks 概率分布之间的一致性问题,从而导致了局部细节模糊与保真度下降的问题。为缓解这些困境,本文精心设计了新颖的基于 CLIP 的注意力与概率图引导网络(CPNet)以推断高保真说话人脸视频。具体而言,考虑到细粒度特征重标定的需求,利用基于 clip 的注意力浓缩器从主流的 CLIP 模型迁移具有丰富语义先验的知识。此外,为保证概率空间的一致性并抑制 landmark 歧义,我们创造性地提出以人脸 landmark 的密度图作为辅助监督信号来引导生成帧的 landmark 分布学习。在广泛使用基准数据集上的大量实验证明了我们的 CPNet 在图像与唇形同步质量上相对于 SOTA 方法的优越性。此外,还进行了一组研究以消融各个关键组件的影响。
引用
@article{arxiv.2305.13962,
title = {CPNet: Exploiting CLIP-based Attention Condenser and Probability Map Guidance for High-fidelity Talking Face Generation},
author = {Jingning Xu and Benlai Tang and Mingjie Wang and Minghao Li and Meirong Ma},
journal= {arXiv preprint arXiv:2305.13962},
year = {2023}
}
备注
Accepted by ICME 2023