基于 Farasa 分词与 AraBERT 的细粒度阿拉伯语推文方言识别
计算与语言
2021-02-23 v2
摘要
本文介绍了我们解决 EACL WANLP-2021 共享任务 1:细粒度阿拉伯语方言识别(NADI)的方法。该任务旨在开发一个系统,用于识别一条以现代标准阿拉伯语或方言形式出现的阿拉伯语推文所来自的地理位置(国家/省份)。我们将该任务分为两部分解决。第一部分涉及对提供的数据集进行预处理,包括清洗、补充和对文本各部分进行分词。随后,我们使用两种基于 Transformer 的模型 AraBERT 和 AraELECTRA 的不同版本进行实验。我们的最终方法在四个子任务中取得了 0.216、0.235、0.054 和 0.043 的宏 F1 分数,并在 MSA 识别子任务中排名第二,在 DA 识别子任务中排名第四。
引用
@article{arxiv.2102.09749,
title = {Dialect Identification in Nuanced Arabic Tweets Using Farasa Segmentation and AraBERT},
author = {Anshul Wadhawan},
journal= {arXiv preprint arXiv:2102.09749},
year = {2021}
}