鲁棒开集语音语言识别及 CU MultiLang 数据集
计算与语言
2023-08-30 v1 人工智能
机器学习
音频与语音处理
摘要
大多数最先进(SOTA)的语音语言识别模型为闭集;换言之,它们只能输出训练所用类别集合中的语言标签。然而,开集语音语言识别系统获得了在输入不属于原有任何语言时进行检测的能力。本文实现一种新颖的开集语音语言识别方法,其使用 MFCC 与音高特征、TDNN 模型提取有意义的特征嵌入、对 softmax 输出进行置信度阈值化,以及 LDA 与 pLDA 用于学习分类新的未知语言。我们提出一个语音语言识别系统,在已训练语言上达到 91.76% 准确率,并具备即时适配未知语言的能力。为此,我们还构建了 CU MultiLang Dataset,一个大型且多样的多语言语音语料库,用于训练和评估我们的系统。
引用
@article{arxiv.2308.14951,
title = {Robust Open-Set Spoken Language Identification and the CU MultiLang Dataset},
author = {Mustafa Eyceoz and Justin Lee and Siddharth Pittie and Homayoon Beigi},
journal= {arXiv preprint arXiv:2308.14951},
year = {2023}
}
备注
6pages, 1 table, 6 figures