中文

面向无监督语音识别与合成的量化的语音表征学习

计算与语言 2020-02-06 v2 声音 音频与语音处理

摘要

本文提出一种序列表征量化自编码器(SeqRQ-AE),从主要是未配对的音频数据中学习,并生成与语音语句的音素序列非常接近的表征序列。这通过适当的时间分割使表征与音素同步,以及适当的语音聚类使不同表征的总数接近音素数量来实现。不同表征与音素之间的映射由少量标注配对数据学习得到。在 LJSpeech 上的初步实验表明,所学得的元音表征在潜空间中的相对位置与语言学专家定义的 IPA 元音图中所示具有良好的平行性。在少于 20 分钟标注语音的情况下,我们的方法在音素识别上优于现有方法,并能够合成可懂度优于基线模型的可懂语音。

关键词

引用

@article{arxiv.1910.12729,
  title  = {Towards Unsupervised Speech Recognition and Synthesis with Quantized Speech Representation Learning},
  author = {Alexander H. Liu and Tao Tu and Hung-yi Lee and Lin-shan Lee},
  journal= {arXiv preprint arXiv:1910.12729},
  year   = {2020}
}

备注

ICASSP 2020, equal contribution from first two authors