看见你所言:由唇读专家引导的说话人脸生成
计算机视觉与模式识别
2023-03-31 v1 人工智能
图像与视频处理
摘要
说话人脸生成,亦称语音到唇部生成,根据给定的连贯语音输入重建关于唇部的面部运动。先前的研究揭示了唇语同步与视觉质量的重要性。尽管取得诸多进展,它们几乎未关注唇部运动的内容,即所说词语的视觉可懂度,而这是生成质量的一个重要方面。为解决该问题,我们提出使用唇读专家通过惩罚错误生成结果来提升生成唇区域的可懂度。此外,为弥补数据稀缺,我们以音视觉自监督方式训练唇读专家。借助唇读专家,我们提出一种新颖的对比学习以增强唇语同步,以及一种 transformer 以与视频同步编码音频,同时考虑音频的全局时间依赖。为评估,我们提出一种采用两个不同唇读专家的新策略来衡量生成视频的可懂度。严谨实验表明,我们的方案优于其他最先进(SOTA)方法,如 Wav2Lip,在朗读可懂度上,即 LRS2 数据集上超过 38% 的词错率(WER)与 LRW 数据集上 27.8% 的准确率。我们也在唇语同步上达到 SOTA 性能,并在视觉质量上取得可比性能。
引用
@article{arxiv.2303.17480,
title = {Seeing What You Said: Talking Face Generation Guided by a Lip Reading Expert},
author = {Jiadong Wang and Xinyuan Qian and Malu Zhang and Robby T. Tan and Haizhou Li},
journal= {arXiv preprint arXiv:2303.17480},
year = {2023}
}
备注
accepted by CVPR 2023