中文

基于序列到序列语音转换的日语电子喉语音增强两阶段训练方法

声音 2022-10-20 v1 音频与语音处理

摘要

序列到序列(seq2seq)语音转换(VC)模型在将电子喉(EL)语音转换为正常语音(EL2SP)方面相比传统 VC 模型具有更大的潜力。然而,基于 seq2seq VC 的 EL2SP 需要足够大量的平行数据用于模型训练,并且在训练数据不足时会出现显著的性能下降。为解决此问题,我们提出一种新颖的两阶段策略,在仅有少量平行数据集可用时优化基于 seq2seq VC 的 EL2SP 性能。与以往研究中使用高质量数据增强不同,我们首先将大量不完美的 EL 与正常语音合成平行数据与原数据集结合进行 VC 训练。然后,仅使用原始平行数据集进行第二阶段训练。结果表明,所提方法逐步提升了基于 seq2seq VC 的 EL2SP 性能。

关键词

引用

@article{arxiv.2210.10314,
  title  = {Two-stage training method for Japanese electrolaryngeal speech enhancement based on sequence-to-sequence voice conversion},
  author = {Ding Ma and Lester Phillip Violeta and Kazuhiro Kobayashi and Tomoki Toda},
  journal= {arXiv preprint arXiv:2210.10314},
  year   = {2022}
}

备注

Accepted to SLT 2022