缩减与重构:面向低资源拼音文字语言的ASR
音频与语音处理
2021-09-13 v2 人工智能
计算与语言
机器学习
声音
摘要
本工作提出了一种看似简单但有效的技术,用于改进拼音文字语言的低资源自动语音识别(ASR)系统。通过识别这些语言中声学相似的字母集合,我们首先利用具有语言学意义的缩减来缩减ASR系统的输出字母表,随后使用独立模块重构原始字母表。我们证明这减轻了低资源端到端ASR系统的负担并提升了其性能(因为仅需预测缩减后的字母表),且可以设计一个非常简单但有效的重构模块,从缩减字母表中的序列恢复出原始字母表中的序列。我们提出了一种基于有限状态转录器的重构模块,其作用于缩减字母表下的1-best ASR假设。我们使用古吉拉特语和泰卢固语这两种印度语言的ASR系统证明了所提技术的有效性。在仅拥有10小时语音数据的情况下,相较于不使用任何缩减的系统,我们获得了高达7%的相对词错率(WER)降低。
引用
@article{arxiv.2010.09322,
title = {Reduce and Reconstruct: ASR for Low-Resource Phonetic Languages},
author = {Anuj Diwan and Preethi Jyothi},
journal= {arXiv preprint arXiv:2010.09322},
year = {2021}
}
备注
5 pages, 1 figure. Accepted at INTERSPEECH 2021