中文

面向异构数据源的逼真视觉配音

计算机视觉与模式识别 2022-01-19 v1

摘要

少样本视觉配音任务致力于使任意说话头视频的唇部运动与任意语音输入同步。尽管现有方法有一定改进,它们通常要求高质量的同源视频与音频数据源,因而无法充分利用异构数据。实践中,某些情况下难以收集完美的同源数据,例如音频损坏或画面模糊的视频。为探索此类数据并支持高保真少样本视觉配音,本文新颖地提出了一种简单而高效的两阶段框架,具有挖掘异构数据的更高灵活性。具体而言,我们的两阶段范式采用面部关键点作为潜在表示的中间先验,并将唇部运动预测与逼真说话头生成这一核心任务解耦。借此,我们的方法使得两个阶段的子网络可独立利用更易获取的更多可用异构数据训练语料。此外,得益于解耦,我们的框架允许针对给定说话头进行进一步微调,从而在最终合成结果中更好地保持说话人身份。而且,所提方法还能将外观特征从他人迁移至目标说话人。大量实验结果证明了我们的方法在生成与语音高度同步的逼真视频方面优于最先进方法。

关键词

引用

@article{arxiv.2201.06260,
  title  = {Towards Realistic Visual Dubbing with Heterogeneous Sources},
  author = {Tianyi Xie and Liucheng Liao and Cheng Bi and Benlai Tang and Xiang Yin and Jianfei Yang and Mingjie Wang and Jiali Yao and Yang Zhang and Zejun Ma},
  journal= {arXiv preprint arXiv:2201.06260},
  year   = {2022}
}

备注

9 pages (including references), 7 figures, Accepted in ACM Multimedia, 2021