中文

利用自监督语音模型提升NAM转语音合成 intelligibility

声音 2024-07-29 v1 人工智能 音频与语音处理

摘要

我们提出一种新方法,利用自监督学习和序列到序列(Seq2Seq)技术显著提高非可听 Murmur(NAM)转语音合成的可理解性。不同于传统方法需显式记录真实语音,我们的方法依赖自监督和语音到语音合成来模拟真实语音。尽管使用模拟语音,我们的方法在梅尔倒谱失真(MCD)指标上超越当前最先进(SOTA)方法达29.08%的提升。此外,我们展示了错误率并证明模型能够合成目标语音的新声线。我们还提出了数据增强现有 CSTR NAM TIMIT Plus 语料库的方法,构建基准,使合成语音的词错误率(WER)达42.57%。语音样本可在 https://nam2speech.github.io/NAM2Speech/ 查看。

关键词

引用

@article{arxiv.2407.18541,
  title  = {Towards Improving NAM-to-Speech Synthesis Intelligibility using Self-Supervised Speech Models},
  author = {Neil Shah and Shirish Karande and Vineet Gandhi},
  journal= {arXiv preprint arXiv:2407.18541},
  year   = {2024}
}

备注

Accepted at Interspeech 2024