中文

PseudoVC:利用伪配对数据改进单样本语音转换

音频与语音处理 2025-06-03 v1 声音

摘要

由于单样本语音转换 (VC) 任务的并行训练数据稀缺,各种 VC 系统通常执行波形重建。典型的单样本 VC 系统包含内容编码器和说话人编码器。然而,会出现两类不匹配:一类是训练和推理期间输入到内容编码器的不匹配,另一类是输入到说话人编码器的不匹配。为了解决这些不匹配问题,我们在本文中提出了一种名为 \textit{PseudoVC} 的新型 VC 训练方法。首先,我们引入了一种名为 \textit{Pseudo Conversion} 的创新信息扰动方法来解决第一类不匹配问题。该方法利用预训练的 VC 模型将源话语转换为扰动话语,并在训练期间将其输入到内容编码器。其次,我们提出了一种称为 \textit{Speaker Sampling} 的方法来解决第二类不匹配问题,该方法将在训练期间用同一说话人的另一条话语替换输入到说话人编码器的内容。实验结果表明,我们提出的 \textit{Pseudo Conversion} 优于以往的信息扰动方法,且整体 \textit{PseudoVC} 方法超越了公开可用的 VC 模型。音频示例可供试听。

关键词

引用

@article{arxiv.2506.01039,
  title  = {PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data},
  author = {Songjun Cao and Qinghua Wu and Jie Chen and Jin Li and Long Ma},
  journal= {arXiv preprint arXiv:2506.01039},
  year   = {2025}
}

备注

5 pages, 3 figures