面向无监督语音识别与合成的量化的语音表征学习
计算与语言
2020-02-06 v2 声音
音频与语音处理
摘要
本文提出一种序列表征量化自编码器(SeqRQ-AE),从主要是未配对的音频数据中学习,并生成与语音语句的音素序列非常接近的表征序列。这通过适当的时间分割使表征与音素同步,以及适当的语音聚类使不同表征的总数接近音素数量来实现。不同表征与音素之间的映射由少量标注配对数据学习得到。在 LJSpeech 上的初步实验表明,所学得的元音表征在潜空间中的相对位置与语言学专家定义的 IPA 元音图中所示具有良好的平行性。在少于 20 分钟标注语音的情况下,我们的方法在音素识别上优于现有方法,并能够合成可懂度优于基线模型的可懂语音。
引用
@article{arxiv.1910.12729,
title = {Towards Unsupervised Speech Recognition and Synthesis with Quantized Speech Representation Learning},
author = {Alexander H. Liu and Tao Tu and Hung-yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:1910.12729},
year = {2020}
}
备注
ICASSP 2020, equal contribution from first two authors