基于极少量未配对语音与文本数据所学音系结构的近零资源几乎无监督语音识别
计算与语言
2018-10-31 v1 声音
音频与语音处理
摘要
为训练 ASR(自动语音识别)系统而制作大量标注语音数据,对于全球超过 95% 的低资源语言而言仍然困难。然而我们注意到,人类婴儿是在未听到大量数据的情况下,通过少量示例词的语音开始学习语言的。本文中我们朝此方向开展了一些初步工作。Audio Word2Vec 用于获取口语词的嵌入,其携带从信号中提取的音系信息。自编码器用于基于音素序列的发音特征生成文本词的嵌入。这两组口语词与文本词的嵌入在其各自的潜空间中描述了词间相似的音系结构。从音频嵌入到文本嵌入的映射关系实际上给出了词级 ASR。这可以通过在嵌入空间中对齐少量口语词与相应文本词来学习。在初始实验中,仅用 200 个标注口语词和一小时无标注语音数据便取得了 27.5% 的词准确率,虽低但是一个良好的起点。
引用
@article{arxiv.1810.12566,
title = {Almost-unsupervised Speech Recognition with Close-to-zero Resource Based on Phonetic Structures Learned from Very Small Unpaired Speech and Text Data},
author = {Yi-Chen Chen and Chia-Hao Shen and Sung-Feng Huang and Hung-yi Lee and Lin-shan Lee},
journal= {arXiv preprint arXiv:1810.12566},
year = {2018}
}