中文

用于语音转换的新颖且逼真说话人生成

声音 2025-11-11 v1 音频与语音处理

摘要

语音转换模型在保留副语言特征的同时修改说话人风格,使其能够应用于配音和身份保护等应用。然而,大多数语音转换(VC)系统需要访问目标语音,限制了其在目标数据不可用或用户希望转换到全新、未见过的说话人的场景中的应用。为此,我们引入一种轻量级方法 SpeakerVAE,用于生成 VC 的新颖说话人。我们的方法使用深度层次变分自编码器来建模说话人声纹空间。通过从训练好的模型中采样,我们生成用于 VC 流水线的新颖说话人表示。该方法是与各种 VC 模型兼容的灵活插件模块,无需对基础 VC 系统进行联合训练或微调。我们使用最先进的 VC 模型:FACodec 和 CosyVoice2 进行评估。结果表明,该方法成功生成与训练说话人质量相当的新颖、未见的说话人。

关键词

引用

@article{arxiv.2511.07135,
  title  = {Generating Novel and Realistic Speakers for Voice Conversion},
  author = {Meiying Melissa Chen and Zhenyu Wang and Zhiyao Duan},
  journal= {arXiv preprint arXiv:2511.07135},
  year   = {2025}
}