基于稳定化同步损失的音频驱动说话人脸生成
计算机视觉与模式识别
2024-07-19 v3
摘要
说话人脸生成旨在利用给定音频和参考视频,在保持身份与视觉特征的同时,生成具有准确唇形同步和高视觉质量的逼真视频。本文首先指出了现有同步学习方法存在的若干问题,包括由唇同步损失、SyncNet以及身份参考中的嘴唇泄漏所引起的训练不稳定、唇形同步与视觉质量问题。针对这些问题,我们首先引入静默嘴唇生成器来解决嘴唇泄漏问题,其通过改变身份参考的嘴唇以缓解泄漏。随后,我们提出稳定化同步损失与AVSyncNet,以克服由唇同步损失和SyncNet导致的问题。实验表明,我们的模型在视觉质量与唇形同步方面均优于当前最先进(state-of-the-art)的方法。全面的消融研究进一步验证了我们的各项贡献及其协同效应。
引用
@article{arxiv.2307.09368,
title = {Audio-driven Talking Face Generation with Stabilized Synchronization Loss},
author = {Dogucan Yaman and Fevziye Irem Eyiokur and Leonard Bärmann and Hazim Kemal Ekenel and Alexander Waibel},
journal= {arXiv preprint arXiv:2307.09368},
year = {2024}
}
备注
Accepted by ECCV 2024