中文

通过风格感知半参数合成实现用户生成内容的音频驱动配音

计算机视觉与模式识别 2023-09-04 v1

摘要

现有的自动配音方法通常针对专业生成内容(PGC)制作而设计,需要大量训练数据与训练时间以学习特定人物的音视频映射。本文中,我们研究一种对用户生成内容(UGC)制作更可行的音频驱动配音方法。为 UGC 设计方法有两个独特挑战:1)说话人外观多样且任意,因为方法需跨用户泛化;2)单个说话人的可用视频数据非常有限。为应对上述挑战,我们首先引入一个新的风格翻译网络,通过跨模态 AdaIN 模块整合目标的说话风格与源端的说话内容。它使我们的模型能快速适应新说话人。然后,我们进一步开发了一个半参数视频渲染器,通过视频级检索-变形-优化流程充分利用未见说话人的有限训练数据。最后,我们为半参数渲染器提出一种时间正则化,生成更连续的视频。大量实验表明,与现有方法相比,我们的方法生成的视频能准确保持多种说话风格,且所需训练数据与训练时间显著更少。此外,我们的方法比多数近期方法具有更快的测试速度。

关键词

引用

@article{arxiv.2309.00030,
  title  = {Audio-Driven Dubbing for User Generated Contents via Style-Aware Semi-Parametric Synthesis},
  author = {Linsen Song and Wayne Wu and Chaoyou Fu and Chen Change Loy and Ran He},
  journal= {arXiv preprint arXiv:2309.00030},
  year   = {2023}
}

备注

TCSVT 2022