EmoDubber:面向高质量情感可控电影配音
声音
2025-04-28 v3 多媒体
音频与语音处理
摘要
给定一段文本、一个视频片段和参考音频,电影配音任务旨在生成与视频同步的语音,同时克隆所需语音。现有方法存在两个主要缺陷:(1) 它们难以同时实现音视频同步和清晰发音;(2) 缺乏表达用户定义情感的能力。为此,我们提出EmoDubber,一种情感可控配音架构,允许用户指定情感类型和情感强度,同时满足高质量的 lip sync 和发音。具体而言,我们首先设计了 Lip-related Prosody Aligning (LPA),其聚焦于通过持续级别对比学习学习唇部运动与韵律变化之间的内在一致性,以纳入合理的对齐。随后,我们设计了 Pronunciation Enhancing (PE) 策略,通过高效 conformer 融合视频级别音素序列,以提高语音可读性。接着,说话人身份适应模块旨在解码声学先验并注入说话人风格嵌入。随后,采用 Flow-based User Emotion Controlling (FUEC) 用于合成声波,其基于声学先验的 flow matching 预测网络实现,FUEC 通过正负引导机制根据用户的情感指令确定梯度方向和引导比例,这聚焦于放大所需情感的同时抑制其他情感。大量实验结果在三个基准数据集上表明,其性能优于几种最新方法。
引用
@article{arxiv.2412.08988,
title = {EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing},
author = {Gaoxiang Cong and Jiadong Pan and Liang Li and Yuankai Qi and Yuxin Peng and Anton van den Hengel and Jian Yang and Qingming Huang},
journal= {arXiv preprint arXiv:2412.08988},
year = {2025}
}
备注
Accepted to CVPR 2025