中文

基于时序自编码器的端到端唇形同步

计算机视觉与模式识别 2022-03-31 v1 多媒体 声音 音频与语音处理

摘要

我们研究将视频中的唇部运动与音频流同步的问题。我们的解决方案使用在合成数据上训练的双域循环神经网络找到最优对齐,该合成数据通过丢弃和复制视频帧生成。一旦找到对齐,我们修改视频以同步这两个来源。我们的方法在多种已有和新的基准上被证明大幅优于文献中的方法。作为一个应用,我们展示了将文本转语音生成的音频与已有视频流进行鲁棒对齐的能力。我们的代码与样本可在 https://github.com/itsyoavshalev/End-to-End-Lip-Synchronization-with-a-Temporal-AutoEncoder 获取。

关键词

引用

@article{arxiv.2203.16224,
  title  = {End to End Lip Synchronization with a Temporal AutoEncoder},
  author = {Yoav Shalev and Lior Wolf},
  journal= {arXiv preprint arXiv:2203.16224},
  year   = {2022}
}