USTHB 参与 NADI 2023 共享任务:探索阿拉伯语方言识别的预处理与特征工程策略
计算与语言
2023-12-19 v1
摘要
在本文中,我们深入分析了影响阿拉伯语方言识别 NADI'2023 性能的几个关键因素,特别聚焦于涉及国家级方言识别的第一个子任务。我们的研究涵盖了表面预处理、形态学预处理、FastText 向量模型以及 TF-IDF 特征加权拼接的影响。在分类方面,我们采用了线性支持向量分类模型。在评估阶段,我们的系统展示了显著的结果,达到了 62.51% 的 F1 分数。这一成绩与提交给第一个子任务的其他系统所达到的平均 F1 分数(72.91%)相近。
引用
@article{arxiv.2312.10536,
title = {USTHB at NADI 2023 shared task: Exploring Preprocessing and Feature Engineering Strategies for Arabic Dialect Identification},
author = {Mohamed Lichouri and Khaled Lounnas and Aicha Zitouni and Houda Latrache and Rachida Djeradi},
journal= {arXiv preprint arXiv:2312.10536},
year = {2023}
}
备注
Accepted for publication in the conference proceedings of ArabicNLP 2023