多语言瓶颈特征用于改善低资源语言语码转换语音的 ASR 性能
音频与语音处理
2020-11-09 v1 计算与语言
机器学习
声音
摘要
在本工作中,我们探索了在非洲语言语码转换(CS)语音的自动语音识别声学建模中使用多语言瓶颈特征(mBNF)的益处。在目标语言中缺乏标注语料库,一直是开发此类严重低资源语音识别系统的主要挑战。因此,研究利用其他资源较丰富语言的语音语料库来改善语音识别性能的潜力是值得的。为此,我们使用构成免费提供的多语言 NCHLT 语料库一部分的九种南部班图语训练了一个 mBNF 提取器。我们将这些 mBNF 附加到现有的 MFCC、音高特征和 i-vector 上,以训练目标语码转换语言的自动语音识别(ASR)声学模型。我们的结果表明,对于语码转换的英语-isiZulu、英语-isiXhosa、英语-Sesotho 和英语-Setswana 语音,包含 mBNF 特征相较于不含 mBNF 的基线取得了明显的性能提升。
引用
@article{arxiv.2011.03118,
title = {Multilingual Bottleneck Features for Improving ASR Performance of Code-Switched Speech in Under-Resourced Languages},
author = {Trideba Padhi and Astik Biswas and Febe De Wet and Ewald van der Westhuizen and Thomas Niesler},
journal= {arXiv preprint arXiv:2011.03118},
year = {2020}
}
备注
In Proceedings of The First Workshop on Speech Technologies for Code-Switching in Multilingual Communities