中文

由语音相关面部动作单元与音频驱动的说话人脸生成——基于多模态表征融合

计算机视觉与模式识别 2024-11-01 v1 多媒体

摘要

说话人脸生成是指输入任意人脸图像和相应的音频片段,合成唇音同步的说话人脸视频。现有方法不仅忽略了跨模态信息的交互与关系,还忽略了嘴部肌肉的局部驱动信息。在本研究中,我们提出了一种新颖的生成框架,该框架包含一个膨胀非因果时间卷积自注意力网络作为多模态融合模块,以促进跨模态特征的关系学习。此外,我们提出的方法同时使用音频和语音相关的面部动作单元作为驱动信息。语音相关的 AU 信息可以更准确地引导嘴部运动。由于语音与语音相关的 AU 高度相关,我们提出了一个音频到 AU 模块来预测语音相关的 AU 信息。我们利用预训练的 AU 分类器来确保生成的图像包含正确的 AU 信息。我们在 GRID 和 TCD-TIMIT 数据集上验证了所提出模型的有效性。还进行了消融研究以验证每个组件的贡献。定量和定性实验的结果表明,我们的方法在图像质量和唇音同步精度方面均优于现有方法。

关键词

引用

@article{arxiv.2204.12756,
  title  = {Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion},
  author = {Sen Chen and Zhilei Liu and Jiaxing Liu and Longbiao Wang},
  journal= {arXiv preprint arXiv:2204.12756},
  year   = {2024}
}

备注

arXiv admin note: text overlap with arXiv:2110.09951