MM-MovieDubber:面向多模态电影配音的多模态学习方法
多媒体
2025-05-23 v1 计算机视觉与模式识别
摘要
当前的电影配音技术可以使用参考语音和输入视频生成所需的语音,同时保持与画面完全的同步,并有效地传递预期的情感。然而,电影配音的关键方面,包括对各种配音风格的适应、有效处理对话、叙事和独白,以及考虑细微细节(如说话人年龄和性别),仍未得到充分探索。为解决这些挑战,我们引入了一个多模态生成框架。首先,它利用多模态大型视觉-语言模型(VLM)分析视觉输入,实现对配音类型和细粒度属性的识别。其次,它利用大型语音生成模型生成高质量配音,由多模态输入指导。此外,构建了一个包含配音类型和细微细节标注的电影配音数据集,以增强电影理解并提高该多模态框架的配音质量。实验结果在多个基准数据集上显示,性能优于最先进(SOTA)方法。在细节方面,LSE-D、SPK-SIM、EMO-SIM 和 MCD 分别提升了最高可达 1.09%、8.80%、19.08% 和 18.74%。
引用
@article{arxiv.2505.16279,
title = {MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing},
author = {Junjie Zheng and Zihao Chen and Chaofan Ding and Yunming Liang and Yihan Fan and Huan Yang and Lei Xie and Xinhan Di},
journal= {arXiv preprint arXiv:2505.16279},
year = {2025}
}
备注
5 pages, 4 figures, accepted by Interspeech 2025