中文

EZ-VC:零样本任意语种语音转换

声音 2025-05-26 v2 人工智能 音频与语音处理

摘要

语音转换研究近期 increasingly 关注提高现有方法的零样本能力。尽管取得了显著进展,当前架构仍在零样本跨语言设置中表现不佳,也常无法为未见语言和方言的说话者进行泛化。本文采用一种简单且有效的方法,将自监督模型的离散语音表示与基于非自回归扩散-Transformer 条件流匹配语音解码器相结合。我们展示,该架构允许我们以纯文本无监督方式训练语音转换模型。该技术无需多个编码器来解耦语音特征。我们的模型也能在零样本跨语言设置中大放异彩,即便面对未见语言亦能表现出色。演示链接: https://ez-vc.github.io/EZ-VC-Demo/

关键词

引用

@article{arxiv.2505.16691,
  title  = {EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion},
  author = {Advait Joglekar and Divyanshu Singh and Rooshil Rohit Bhatia and S. Umesh},
  journal= {arXiv preprint arXiv:2505.16691},
  year   = {2025}
}