中文

利用联合训练说话人编码器与一致性损失实现跨语言语音转换与表现力语音转换

音频与语音处理 2023-07-04 v1

摘要

语音转换系统在常见语音转换任务的自然度与相似度方面已取得显著进展。然而,其在跨语言语音转换与表现力语音转换等更复杂任务中的性能仍有待完善。在本研究中,我们提出了一种新方法,将联合训练的说话人编码器与从跨语言语音识别模型 Whisper 中提取的内容特征相结合,以实现高质量的跨语言语音转换。此外,我们在联合编码器中引入了说话人一致性损失,提高了转换语音与参考语音之间的相似度。为了进一步探索联合说话人编码器的能力,我们使用音素后验图作为内容特征,使模型能够有效再现参考语音的说话人特征与情感特征。

关键词

引用

@article{arxiv.2307.00393,
  title  = {Using joint training speaker encoder with consistency loss to achieve cross-lingual voice conversion and expressive voice conversion},
  author = {Houjian Guo and Chaoran Liu and Carlos Toshinori Ishi and Hiroshi Ishiguro},
  journal= {arXiv preprint arXiv:2307.00393},
  year   = {2023}
}