中文

探索用于说话人脸生成的音素上下文感知唇形同步

计算机视觉与模式识别 2024-04-02 v3 人工智能 声音 音频与语音处理 图像与视频处理

摘要

说话人脸生成是一项具有挑战性的任务,即合成与自然、真实人脸相契合且需要与给定音频精确同步的面部。由于协同发音现象(孤立音素受前后音素影响),音素的发音随音素上下文而变化。因此,以音素上下文建模唇部运动可生成更具时空对齐性的唇部动作。对此,我们研究了在说话人脸生成中生成唇部运动时的音素上下文。我们提出了上下文感知唇形同步框架(CALS),其显式利用音素上下文来生成目标人脸的唇部运动。CALS 由 Audio-to-Lip 模块与 Lip-to-Face 模块组成。前者基于掩码学习进行预训练,以将每个音素映射到一个上下文化唇动单元。该上下文化唇动单元随后引导后者合成具有上下文感知唇部运动的目标身份。通过大量实验,我们验证了在提出的 CALS 框架中简单利用音素上下文即可有效增强时空对齐。我们还展示了音素上下文对唇形同步的辅助程度,并发现用于唇部生成的有效窗口大小约为 1.2 秒。

关键词

引用

@article{arxiv.2305.19556,
  title  = {Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation},
  author = {Se Jin Park and Minsu Kim and Jeongsoo Choi and Yong Man Ro},
  journal= {arXiv preprint arXiv:2305.19556},
  year   = {2024}
}

备注

Accepted at ICASSP 2024