另一种用于阿拉伯语方言识别的模型
计算与语言
2023-10-24 v1 声音
音频与语音处理
摘要
在本文中,我们描述了一种用于阿拉伯语的口语阿拉伯语方言识别(ADI)模型,该模型在两个基准数据集 ADI-5 和 ADI-17 上持续优于先前发表的结果。我们探索了两种架构变体:ResNet 和 ECAPA-TDNN,结合两类声学特征:MFCC 以及从预训练自监督模型 UniSpeech-SAT Large 提取的特征,以及所有四种变体的融合。我们发现,单独来看,ECAPA-TDNN 网络优于 ResNet,且使用 UniSpeech-SAT 特征的模型大幅优于使用 MFCC 的模型。此外,所有四种变体的融合持续优于单个模型。我们的最佳模型在两个数据集上均优于先前报道的结果,在 ADI-5 和 ADI-17 上的准确率分别为 84.7% 和 96.9%。
引用
@article{arxiv.2310.13812,
title = {Yet Another Model for Arabic Dialect Identification},
author = {Ajinkya Kulkarni and Hanan Aldarmaki},
journal= {arXiv preprint arXiv:2310.13812},
year = {2023}
}
备注
ACCEPTED AT ArabicNLP 2023