中文

vec2wav 2.0:通过离散标记声码器实现语音转换的提升

音频与语音处理 2025-05-27 v4 人工智能 声音

摘要

我们提出一种新的语音离散标记声码器vec2wav 2.0,以推动语音转换(VC)。我们采用语音自监督模型中的离散标记作为源语音的内容特征,将语音转换问题视为一种 prompted 解码任务。为弥补说话人语音在内容标记中的声音时长损失,vec2wav 2.0利用WavLM特征提供强大的与说话人语音相关的时长信息。提出了一种新型自适应 Snake 激活函数,以更好地将时长融入波形重建过程中。如此一来,vec2wav 2.0能够根据不同的参考提示灵活地操控说话人语音。vec2wav 2.0无需监督数据即可有效训练。实验结果表明,vec2wav 2.0在任何到任何语音转换中在音频质量和说话人相似度方面均显著优于所有其他基线方法。消融研究验证了所提出技术的效果。此外,vec2wav 2.0即使仅在单语料库上训练,也能实现具有竞争力的跨语言语音转换。因此,vec2wav 2.0表明仅通过语音标记声码器即可潜在地操控说话人语音,推动了语音转换和语音合成的前沿进展。

关键词

引用

@article{arxiv.2409.01995,
  title  = {vec2wav 2.0: Advancing Voice Conversion via Discrete Token Vocoders},
  author = {Yiwei Guo and Zhihan Li and Junjie Li and Chenpeng Du and Hankun Wang and Shuai Wang and Xie Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2409.01995},
  year   = {2025}
}

备注

5 pages, 3 figures, 2 tables. Demo page: https://cantabile-kwok.github.io/vec2wav2/