中文

基于自监督表征的语音转换中使用无标注外部数据的对抗说话人解耦

声音 2023-05-17 v1 计算与语言 音频与语音处理

摘要

如今,基于识别-合成的方法在语音转换(VC)中已相当流行。通过引入从自动语音识别(ASR)模型提取的具有良好解耦特性的语言学特征,VC 性能取得了显著突破。近来,使用大规模无标注语音语料库训练的自监督学习(SSL)方法已应用于关注内容信息的下游任务,这适用于 VC 任务。然而,SSL 表征中大量的说话人信息显著降低了音色相似度与转换语音的质量。为解决此问题,我们提出了一种以 SSL 表征为输入的高相似度任意到一语音转换方法。我们利用外部无标注语料库在合成模块中引入对抗训练机制。训练了两个辅助判别器,分别用于区分一段梅尔频谱是否由声学模型转换得到,以及一段内容嵌入是否包含来自外部语料库的说话人信息。实验结果表明,我们所提方法取得了与监督方法相当的相似度且自然度更高,而监督方法需要大量标注语料进行训练,并可用于提升以其他 SSL 表征为输入的 VC 方法的相似度。

关键词

引用

@article{arxiv.2305.09167,
  title  = {Adversarial Speaker Disentanglement Using Unannotated External Data for Self-supervised Representation Based Voice Conversion},
  author = {Xintao Zhao and Shuai Wang and Yang Chao and Zhiyong Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2305.09167},
  year   = {2023}
}

备注

Accepted by ICME 2023