中文

用于语音转换的无监督端到端离散语言单元学习

计算与语言 2020-04-24 v3 机器学习 声音 音频与语音处理

摘要

我们提出了一种无监督端到端训练方案,在不使用任何标签的情况下从语音中发现离散子词单元。离散子词单元在 ASR-TTS 自动编码器重构设定下学习:训练一个 ASR-Encoder 以在给定多种说话人的情况下发现一组通用语言单元,并训练一个 TTS-Decoder 将发现的单元投影回指定的语音。我们提出了一种离散编码方法——多标签二值向量(Multilabel-Binary Vectors, MBV),以使 ASR-TTS 自动编码器可微。我们发现所提出的编码方法能够自动从说话人风格中提取语音内容,且足以覆盖给定语言中的完整语言内容。因此,TTS-Decoder 可以合成与 ASR-Encoder 输入内容相同但具有不同说话人特征的语音,从而实现语音转换(VC)。我们进一步使用对抗训练提升 VC 质量,训练一个 TTS-Patcher 来增强 TTS-Decoder 的输出。客观与主观评测表明,所提方法通过消除说话人身份同时保留语音内容,提供了强劲的 VC 结果。在 ZeroSpeech 2019 挑战赛中,我们在低比特率方面取得了优异表现。

关键词

引用

@article{arxiv.1905.11563,
  title  = {Unsupervised End-to-End Learning of Discrete Linguistic Units for Voice Conversion},
  author = {Andy T. Liu and Po-chun Hsu and Hung-yi Lee},
  journal= {arXiv preprint arXiv:1905.11563},
  year   = {2020}
}

备注

Accepted by Interspeech 2019, Graz, Austria