中文

StableVC:基于条件流匹配的可控零样本语音转换

音频与语音处理 2024-12-11 v2 声音

摘要

零样本语音转换(VC)旨在将来自源说话者的语音 timbre 转换为任意未见说话者的语音,同时保留原始语言内容。尽管近期基于语言模型或扩散模型的方法在零样本 VC 上取得了进展,但仍面临若干挑战:1) 当前方法主要聚焦于从未见说话者转换 timbre,无法独立地将 timbre 和 style 转换为不同的未见说话者;2) 这些方法常因自回归建模方法或大量采样步骤导致推理速度较慢;3) 转换后样本的质量和相似度仍不完全令人满意。为此,我们提出一种名为 StableVC 的可控零样本 VC 方法,旨在将语音中的 timbre 和 style 从源语音转换为不同的未见目标说话者。具体而言,我们将语音分解为语言内容、timbre 和 style,然后采用条件流匹配模块基于这些分解特征重建高质量的 mel 频谱图。为有效地以零样本方式捕获 timbre 和 style,我们引入一种带自适应门控的新型双注意力机制,而非采用常规的特征拼接方法。通过非自回归设计,StableVC 能高效地从不同未见说话者中捕获复杂的 timbre 和 style,并显著快于实时生成高质量语音。实验结果表明,我们提出的 StableVC 在零样本 VC 中超越了最新的基线系统,能够灵活地控制来自不同未见说话者的 timbre 和 style。此外,StableVC 在自回归和扩散基线方法中分别实现约 25 倍和 1.65 倍的加速采样。

关键词

引用

@article{arxiv.2412.04724,
  title  = {StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching},
  author = {Jixun Yao and Yuguang Yang and Yu Pan and Ziqian Ning and Jiaohao Ye and Hongbin Zhou and Lei Xie},
  journal= {arXiv preprint arXiv:2412.04724},
  year   = {2024}
}

备注

Accepted by AAAI 2025