基于音视频与文本嵌入联合学习语音结构实现极低资源下从半监督到近乎无监督的语音识别
计算与语言
2019-04-11 v1 声音
音频与语音处理
摘要
为训练 ASR(自动语音识别)系统而制作大量标注语音数据,对于全球超过95%的低资源语言而言仍然困难。然而,我们注意到人类婴儿是通过少量示例词的发音(或语音结构)开始学习语言,并将此类知识“泛化”到其他词,而无需听到大量数据。我们在此方向上开展了一些初步工作。Audio Word2Vec 用于从口语词(信号段)中学习语音结构,而另一个自编码器用于从文本词中学习语音结构。上述两者之间的关系可以联合学习,或在上述两者训练良好后分别学习。该关系可用于极低资源下的语音识别。在 TIMIT 数据集上的初步实验中,仅使用 2.1 小时语音数据(其中标注了 2500 个口语词,其余未标注)得到了 44.6% 的词错误率;若给定 4.1 小时语音数据(其中标注了 20000 个口语词),该数字可降至 34.2%。这些结果尚不令人满意,但是一个良好的起点。
引用
@article{arxiv.1904.05078,
title = {From Semi-supervised to Almost-unsupervised Speech Recognition with Very-low Resource by Jointly Learning Phonetic Structures from Audio and Text Embeddings},
author = {Yi-Chen Chen and Sung-Feng Huang and Hung-yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:1904.05078},
year = {2019}
}