中文

面向增强说话人脸视频生成与评估的音视频说话表示专家

计算机视觉与模式识别 2024-05-08 v1

摘要

在说话人脸生成任务中,目标是生成与对应音频同步的嘴型视频,同时保持视觉细节和身份信息。当前方法面临在学习准确的嘴型同步的同时避免对视觉质量产生不利影响,以及对此类同步进行稳健评估的挑战。为此,我们提出利用音视频说话表示专家(AV-HuBERT)在训练期间计算嘴型同步损失。此外,利用 AV-HuBERT 的特征,我们引入了三个新的嘴型同步评估指标,旨在全面评估嘴型同步性能。实验结果 along with detailed ablation study 表明我们方法的有效性以及所提出评估指标的实用性。

关键词

引用

@article{arxiv.2405.04327,
  title  = {Audio-Visual Speech Representation Expert for Enhanced Talking Face Video Generation and Evaluation},
  author = {Dogucan Yaman and Fevziye Irem Eyiokur and Leonard Bärmann and Seymanur Aktı and Hazım Kemal Ekenel and Alexander Waibel},
  journal= {arXiv preprint arXiv:2405.04327},
  year   = {2024}
}

备注

CVPR2024 NTIRE Workshop