中文

基于注意力的唇部音视觉合成用于真实场景说话人脸生成

计算机视觉与模式识别 2022-04-12 v1 多媒体 图像与视频处理

摘要

具有重大实用意义的说话人脸生成在近期音视觉研究中吸引了更多关注。如何实现准确的唇部同步是一个尚待深入研究的长期挑战。受 xxx 启发,本文通过将空间注意力模块与通道注意力模块融入唇同步策略,提出 AttnWav2Lip 模型。所提出的 AttnWav2Lip 模型能够更多关注唇部区域重建,而非聚焦于人脸图像中不重要的区域。据我们所知,这是首次尝试将注意力机制引入说话人脸生成方案。我们进行了大量实验以评估所提模型的有效性。与以 LSE-D 和 LSE-C 指标衡量的基线相比,在包括 LRW、LRS2 和 LRS3 在内的基准唇合成数据集上展示了更优性能。

关键词

引用

@article{arxiv.2203.03984,
  title  = {Attention-Based Lip Audio-Visual Synthesis for Talking Face Generation in the Wild},
  author = {Ganglai Wang and Peng Zhang and Lei Xie and Wei Huang and Yufei Zha},
  journal= {arXiv preprint arXiv:2203.03984},
  year   = {2022}
}