基于BERT的多任务模型用于国家与省级现代标准阿拉伯语及方言阿拉伯语识别
计算与语言
2021-06-24 v1
摘要
方言与标准语言识别是诸多阿拉伯语自然语言处理应用的关键任务。本文介绍我们提交的基于深度学习的系统,该系统参与第二届NADI共享任务,用于国家级与省级现代标准阿拉伯语(MSA)和方言阿拉伯语(DA)识别。该系统基于端到端深度多任务学习(MTL)模型,以同时处理国家级与省级MSA/DA识别。该MTL模型由一个共享的双向编码器表示变换器(Bidirectional Encoder Representation Transformers, BERT)编码器、两个任务特定注意力层以及两个分类器组成。我们的核心思想是利用任务判别性与任务间共享特征来进行国家与省级MSA/DA识别。所得结果表明,我们的MTL模型在大多数子任务上优于单任务模型。
引用
@article{arxiv.2106.12495,
title = {BERT-based Multi-Task Model for Country and Province Level Modern Standard Arabic and Dialectal Arabic Identification},
author = {Abdellah El Mekki and Abdelkader El Mahdaouy and Kabil Essefar and Nabil El Mamoun and Ismail Berrada and Ahmed Khoumsi},
journal= {arXiv preprint arXiv:2106.12495},
year = {2021}
}