中文

Pureformer-VC:基于纯 Transformer 块和三元判别训练的非并行单样本语音转换

声音 2024-11-26 v3 人工智能 音频与语音处理

摘要

单样本语音转换 (VC) 旨在仅凭一个语音样本即可将任意源语音的 timbre 转换为目标说话人的声线。现有的基于风格迁移的 VC 方法依赖于语音表征的解耦,并在准确地和独立地编码每个语音组件以及有效地将其重构为转换后语音方面存在困难。为此,我们提出了 Pureformer-VC,该模型利用 Conformer 块构建解耦编码器,并使用 Zipformer 块构建风格迁移解码器作为生成器。在解码器中,我们使用有效的 styleformer 块将说话人特征有效地整合到生成语音中。该模型采用生成式 VAE 损失用于编码组件,并使用三元损失进行无监督判别训练。我们将 styleformer 方法应用于 Zipformer 的共享权重进行风格迁移。实验结果表明,所提出的模型在单样本语音转换场景下实现了可比的主观评分,并在客观指标上实现了改进。

关键词

引用

@article{arxiv.2409.01668,
  title  = {Pureformer-VC: Non-parallel One-Shot Voice Conversion with Pure Transformer Blocks and Triplet Discriminative Training},
  author = {Wenhan Yao and Zedong Xing and Xiarun Chen and Jia Liu and Yongqiang He and Weiping Wen},
  journal= {arXiv preprint arXiv:2409.01668},
  year   = {2024}
}

备注

our paper is rejected