中文

RADIO:与参考无关的配音视频合成

计算机视觉与模式识别 2023-11-07 v2 人工智能 机器学习 声音 音频与语音处理

摘要

在音频驱动的说话头生成中,最具挑战性的问题之一是在确保精确同步的同时实现高保真细节。在仅给定单张参考图像的情况下,提取有意义的身份属性变得更加困难,常导致网络过于贴近参考的面部与唇部结构。为解决这些问题,我们提出 RADIO,一个旨在生成高质量配音视频的框架,而不受参考图像中姿态或表情的影响。其关键是利用由音频与参考特征组成的潜空间调制解码器层。此外,我们在解码器中引入 ViT 模块以强调高保真细节,尤其是唇部区域。实验结果表明,RADIO 在不损失保真度的前提下展现出高同步性。尤其在参考帧与真实值偏差显著的严苛场景下,我们的方法优于 SOTA 方法,凸显了其鲁棒性。

关键词

引用

@article{arxiv.2309.01950,
  title  = {RADIO: Reference-Agnostic Dubbing Video Synthesis},
  author = {Dongyeun Lee and Chaewon Kim and Sangjoon Yu and Jaejun Yoo and Gyeong-Moon Park},
  journal= {arXiv preprint arXiv:2309.01950},
  year   = {2023}
}

备注

Accepted by WACV 2024