中文

StyleDubber:面向电影配音的多尺度风格学习

计算与语言 2024-07-03 v3

摘要

给定剧本,电影配音(视觉语音克隆,V2C)的挑战在于基于参考音频的语调,生成在时间和情感上与视频高度对齐的语音。现有的最先进 V2C 模型根据视频帧之间的划分来拆分剧本中的音素,这解决了时间对齐问题,但导致了音素发音不完整和身份稳定性差。为解决这一问题,我们提出了 StyleDubber,将配音学习从帧级切换到音素级。它包含三个主要组件:(1) 一个在音素级操作的多模态风格适配器,用于从参考音频中学习发音风格,并生成由视频中面部表情告知的中间表示;(2) 一个话语级风格学习模块,指导从中间嵌入到 mel 频谱图解码和细化的过程,以改善整体风格表达;以及 (3) 一个音素引导的唇形对齐器,以保持唇形同步。在两个主要基准 V2C 和 Grid 上的大量实验表明,与当前最先进的方法相比,所提方法具有优越的性能。代码将在 https://github.com/GalaxyCong/StyleDubber 提供。

关键词

引用

@article{arxiv.2402.12636,
  title  = {StyleDubber: Towards Multi-Scale Style Learning for Movie Dubbing},
  author = {Gaoxiang Cong and Yuankai Qi and Liang Li and Amin Beheshti and Zhedong Zhang and Anton van den Hengel and Ming-Hsuan Yang and Chenggang Yan and Qingming Huang},
  journal= {arXiv preprint arXiv:2402.12636},
  year   = {2024}
}