中文

适配 MARBERT 以改进阿拉伯方言识别:NADI 2021 共享任务参赛方案

计算与语言 2021-03-02 v1

摘要

本文中,我们攻克了细粒度阿拉伯方言识别(NADI)共享任务(Abdul-Mageed 等,2021),并在其全部四个子任务上展示了最先进的结果。这些任务旨在以国家和省份两个层级识别短方言阿拉伯语(DA)与现代标准阿拉伯语(MSA)话语的地理来源。我们的最终模型是基于 MARBERT 构建的多种变体的集成,在国家层级的 DA 开发集上取得了 34.03% 的 F1 分数——相较先前工作提升了 7.63%。

关键词

引用

@article{arxiv.2103.01065,
  title  = {Adapting MARBERT for Improved Arabic Dialect Identification: Submission to the NADI 2021 Shared Task},
  author = {Badr AlKhamissi and Mohamed Gabr and Muhammad ElNokrashy and Khaled Essam},
  journal= {arXiv preprint arXiv:2103.01065},
  year   = {2021}
}

备注

This work was accepted at the Sixth Arabic Natural Language Processing Workshop (EACL/WANLP 2021)