利用 Transformer 模型与语言信息预训练改进阿拉伯语自然语言推理
计算与语言
2023-07-28 v1
摘要
本文处理自然语言处理(NLP)领域中阿拉伯语文本数据的分类问题,特别关注自然语言推理(NLI)与矛盾检测(CD)。阿拉伯语被视为资源贫乏语言,即可用数据集很少,导致 NLP 方法可用性有限。为克服此限制,我们从公开可用资源创建了一个专用数据集。随后,基于 transformer 的机器学习模型被训练与评估。我们发现,当我们应用如命名实体识别(NER)等语言信息预训练方法时,特定语言模型(AraBERT)可与最先进的多语言方法竞争。据我们所知,这是该任务在阿拉伯语中的首次大规模评估,也是多任务预训练在此背景下的首次应用。
引用
@article{arxiv.2307.14666,
title = {Improving Natural Language Inference in Arabic using Transformer Models and Linguistically Informed Pre-Training},
author = {Mohammad Majd Saad Al Deen and Maren Pielka and Jörn Hees and Bouthaina Soulef Abdou and Rafet Sifa},
journal= {arXiv preprint arXiv:2307.14666},
year = {2023}
}
备注
submitted to IEEE SSCI 2023