ASR2K:无需音频即可为约2000种语言提供语音识别
计算与语言
2022-09-08 v1
摘要
近期多数语音识别模型依赖大型有监督数据集,而许多低资源语言并无此类数据。本文提出一种无需目标语言任何音频的语音识别流程。唯一假设是我们可获取原始文本数据集或一组n-gram统计量。我们的语音流程由声学、发音与语言模型三部分组成。不同于标准流程,我们的声学与发音模型使用无任何监督的多语言模型;语言模型由n-gram统计量或原始文本数据集构建。我们将该方法与Crubadan(一个大型濒危语言n-gram数据库)结合,为1909种语言构建了语音识别。此外,我们在两个数据集Common Voice与CMU Wilderness dataset上对129种语言测试了该方法。仅使用Crubadan统计量时,我们在Wilderness数据集上达到50% CER与74% WER,在使用10000条原始文本语句时分别提升至45% CER与69% WER。
引用
@article{arxiv.2209.02842,
title = {ASR2K: Speech Recognition for Around 2000 Languages without Audio},
author = {Xinjian Li and Florian Metze and David R Mortensen and Alan W Black and Shinji Watanabe},
journal= {arXiv preprint arXiv:2209.02842},
year = {2022}
}
备注
INTERSPEECH 2022