中文

MM-Sonate: 多模态可控音视频生成与零样法语语音克隆

声音 2026-01-09 v2 人工智能 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

联合音视频生成旨在合成同步的多感官内容,但当前的统一模型在细粒度声学控制方面存在挑战,尤其是难以实现身份保持的语音。现有方法要么因级联生成而导致时间错位,要么缺乏在联合合成框架中实现零样法语语音克隆的能力。本文提出了 MM-Sonate,一个多模态流匹配框架,统一了可控音视频联合生成与零样法语语音克隆能力。不同于依赖粗糙语义描述的先前方法,MM-Sonate 利用统一的指令-音素输入来确保严格的语言和时间对齐。为实现零样法语语音克隆,我们引入了声纹注入机制,有效地将说话人身份从语言内容中解耦。此外,针对多模态环境中标准分类自由引导的局限性,我们提出了基于噪声的负条件策略,该策略利用自然噪声先验显著提升声学保真度。实证评估表明,MM-Sonate 在联合生成基准测试中实现了新的最佳性能,在唇部同步和语音可理解性方面显著优于基线方法,同时在语音克隆保真度方面相当于专门的文本到语音系统。

关键词

引用

@article{arxiv.2601.01568,
  title  = {MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning},
  author = {Chunyu Qiang and Jun Wang and Xiaopeng Wang and Kang Yin and Yuxin Guo},
  journal= {arXiv preprint arXiv:2601.01568},
  year   = {2026}
}