适配 MARBERT 以改进阿拉伯方言识别:NADI 2021 共享任务参赛方案
计算与语言
2021-03-02 v1
摘要
本文中,我们攻克了细粒度阿拉伯方言识别(NADI)共享任务(Abdul-Mageed 等,2021),并在其全部四个子任务上展示了最先进的结果。这些任务旨在以国家和省份两个层级识别短方言阿拉伯语(DA)与现代标准阿拉伯语(MSA)话语的地理来源。我们的最终模型是基于 MARBERT 构建的多种变体的集成,在国家层级的 DA 开发集上取得了 34.03% 的 F1 分数——相较先前工作提升了 7.63%。
引用
@article{arxiv.2103.01065,
title = {Adapting MARBERT for Improved Arabic Dialect Identification: Submission to the NADI 2021 Shared Task},
author = {Badr AlKhamissi and Mohamed Gabr and Muhammad ElNokrashy and Khaled Essam},
journal= {arXiv preprint arXiv:2103.01065},
year = {2021}
}
备注
This work was accepted at the Sixth Arabic Natural Language Processing Workshop (EACL/WANLP 2021)