中文

基于音频与言语相关面部动作单元的说话头生成

计算机视觉与模式识别 2021-10-20 v1 多媒体

摘要

说话头生成任务旨在通过输入任意人脸图像和音频片段,合成唇形同步的说话头视频。现有多数方法忽略了嘴部肌肉的局部驱动信息。本文提出一种新颖的循环生成网络,同时使用音频和言语相关的面部动作单元(AUs)作为驱动信息。与嘴部相关的AU信息能够更准确地引导嘴部运动。由于言语与言语相关AUs高度相关,我们在系统中提出一个音频到AU模块,从语音中预测言语相关的AU信息。此外,我们使用AU分类器以确保生成图像包含正确的AU信息。还构建了帧判别器用于对抗训练,以提升生成人脸的真实感。我们在GRID数据集和TCD-TIMIT数据集上验证了模型的有效性,并进行了消融实验以验证模型中各组件的贡献。定量与定性实验表明,我们的方法在图像质量和唇形同步精度上均优于现有方法。

关键词

引用

@article{arxiv.2110.09951,
  title  = {Talking Head Generation with Audio and Speech Related Facial Action Units},
  author = {Sen Chen and Zhilei Liu and Jiaxing Liu and Zhengxiang Yan and Longbiao Wang},
  journal= {arXiv preprint arXiv:2110.09951},
  year   = {2021}
}

备注

Accepted by BMVC 2021