中文

ACE-VC:基于显式解耦自监督语音表征的自适应可控语音转换

声音 2023-02-17 v1 机器学习 音频与语音处理

摘要

在本工作中,我们提出一种使用自监督学习训练的语音表征的零样本语音转换方法。首先,我们开发一个多任务模型,将语音 utterance 分解为语言学内容、说话人特征和说话风格等特征。为解耦内容与说话人表征,我们提出一种基于Siamese网络的训练策略,其鼓励原始音频与音高偏移音频的内容表征之间的相似性。接下来,我们开发带有音高与时长预测器的合成模型,能从其解耦表征有效重建语音信号。我们的框架允许可控且说话人自适应的合成,以执行零样本任意到任意语音转换,在评估说话人相似度、可懂度与自然度的指标上取得最先进结果。仅使用目标说话人10秒数据,我们的框架可执行语音交换,并对已见说话人取得5.5%的说话人验证EER,对未见说话人为8.4%。

关键词

引用

@article{arxiv.2302.08137,
  title  = {ACE-VC: Adaptive and Controllable Voice Conversion using Explicitly Disentangled Self-supervised Speech Representations},
  author = {Shehzeen Hussain and Paarth Neekhara and Jocelyn Huang and Jason Li and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2302.08137},
  year   = {2023}
}

备注

Published as a conference paper at ICASSP 2023