中文

通过分层韵律模型学习电影配音

计算与语言 2023-04-05 v2 声音 音频与语音处理

摘要

给定一段文本、一个视频片段和一段参考音频,电影配音(亦称视觉语音克隆 V2C)任务旨在以所需说话人声音为参考,生成与视频中呈现的说话人情感相匹配的语音。V2C 比传统文本到语音任务更具挑战性,因为它额外要求生成的语音精确匹配视频中呈现的变化情感与说话速度。与以往工作不同,我们提出了一种新颖的电影配音架构,通过分层韵律建模从唇部、面部和场景三个方面将视觉信息对应到语音韵律,以解决这些问题。具体而言,我们将唇部运动对齐到语音时长,并基于近期心理学发现的效价与唤醒表征,通过注意力机制将面部表情传递到语音能量与音高。此外,我们设计了一个情感增强器以从全局视频场景捕捉氛围。所有这些嵌入共同用于生成梅尔频谱图,再通过现有声码器转换为语音波形。在 Chem 和 V2C 基准数据集上的大量实验结果证明了所提方法的优越性能。源代码与训练好的模型将公开发布。

关键词

引用

@article{arxiv.2212.04054,
  title  = {Learning to Dub Movies via Hierarchical Prosody Models},
  author = {Gaoxiang Cong and Liang Li and Yuankai Qi and Zhengjun Zha and Qi Wu and Wenyu Wang and Bin Jiang and Ming-Hsuan Yang and Qingming Huang},
  journal= {arXiv preprint arXiv:2212.04054},
  year   = {2023}
}

备注

accepted to CVPR 2023