UTD-CRSS 针对 MGB-3 阿拉伯方言识别的提交系统:广播语音的前端与后端进展
音频与语音处理
2017-10-03 v1 声音
摘要
本研究介绍了德克萨斯大学达拉斯分校鲁棒语音系统中心(UTD-CRSS)提交至 MGB-3 阿拉伯方言识别(ADI)子任务的系统。该任务旨在区分五种阿拉伯方言,包括埃及方言、海湾方言、黎凡特方言、北非方言和现代标准阿拉伯语。我们开发了多个具有不同前端表示和后端分类器的单一系统。在前端层面,研究了 Mel 频率倒谱系数(MFCCs)和两种瓶颈特征(BNF)等特征提取方法在 i-Vector 框架中的应用。在后端层面,交替应用了高斯后端(GB)和生成式对抗网络(GANs)分类器。通过对随机选取的部分开发集数据进行数据增强,ADI 子任务的最佳提交系统(对比系统)达到了 76.94% 的准确率。此外,对提交系统进行评估后修正,最终准确率提升至 79.76%,这是迄今为止该挑战赛在测试数据集上取得的最佳性能。
引用
@article{arxiv.1710.00113,
title = {UTD-CRSS Submission for MGB-3 Arabic Dialect Identification: Front-end and Back-end Advancements on Broadcast Speech},
author = {Ahmet E. Bulut and Qian Zhang and Chunlei Zhang and Fahimeh Bahmaninezhad and John H. L. Hansen},
journal= {arXiv preprint arXiv:1710.00113},
year = {2017}
}