中文

基于位置可变卷积的端到端零样本语音转换

音频与语音处理 2024-04-04 v3 声音

摘要

零样本语音转换正成为一个日益流行的研究课题,因为它有望将语音转换为任意说话人的声音。然而,针对该任务的端到端方法研究相对较少,这类方法颇具吸引力,因为它们无需单独的声码器从中间特征生成音频。在本工作中,我们提出 LVC-VC,一种使用位置可变卷积(LVCs)联合建模转换与语音合成过程的端到端零样本语音转换模型。LVC-VC 利用精心设计的、内容与说话人信息解耦的输入特征,并采用类神经声码器的架构,该架构利用 LVCs 高效融合二者并在直接合成时域音频的同时完成语音转换。实验表明,与多个基线相比,我们的模型在语音风格迁移与语音可懂度之间取得了尤为均衡的性能。

关键词

引用

@article{arxiv.2205.09784,
  title  = {End-to-End Zero-Shot Voice Conversion with Location-Variable Convolutions},
  author = {Wonjune Kang and Mark Hasegawa-Johnson and Deb Roy},
  journal= {arXiv preprint arXiv:2205.09784},
  year   = {2024}
}

备注

INTERSPEECH 2023