基于注意力视听一致性学习的任意说话人脸生成
计算机视觉与模式识别
2020-05-14 v2
摘要
说话人脸生成旨在根据给定的语音片段和人脸图像,合成具有精确唇形同步以及整个视频中面部运动平滑过渡的人脸视频。现有大多数方法主要关注单张图像中的信息解耦或帧间时序信息的学习。然而,在合成过程中,音频与视频信息之间的跨模态一致性尚未得到很好解决。本文提出一种新颖的任意说话人脸生成框架,通过所提出的非对称互信息估计器(AMIE)来发掘视听一致性。此外,我们提出动态注意力(DA)模块,在训练阶段选择性聚焦于输入图像的唇部区域,以进一步增强唇形同步。在基准 LRW 数据集和 GRID 数据集上的实验结果在常用指标上超越了最先进的方法,并在性别与姿态变化下具有鲁棒的高分辨率合成能力。
引用
@article{arxiv.1812.06589,
title = {Arbitrary Talking Face Generation via Attentional Audio-Visual Coherence Learning},
author = {Hao Zhu and Huaibo Huang and Yi Li and Aihua Zheng and Ran He},
journal= {arXiv preprint arXiv:1812.06589},
year = {2020}
}
备注
IJCAI-2020