AraLegal-BERT:面向阿拉伯语法律文本的预训练语言模型
计算与语言
2022-10-18 v1
摘要
BERT 模型在多项语言任务上的有效性已得到充分证实。另一方面,其在法律等狭窄且特定领域的潜力尚未被充分挖掘。在本文中,我们考察了 BERT 如何用于阿拉伯语法律领域,并尝试使用多个不同的领域相关训练与测试数据集从头训练 BERT,以针对若干下游任务对该语言模型进行定制。我们提出了 AraLegal-BERT,一种基于双向编码器 Transformer 的模型,该模型经过充分测试与精心优化,旨在增强自然语言处理(NLP)驱动的解决方案在法理、法律文档与法律实务方面的影响力。我们对 AraLegal-BERT 进行了微调,并在三项自然语言理解(NLU)任务上将其与三种阿拉伯语 BERT 变体进行了评估。结果表明,AraLegal-BERT 的基础版本在法律文本上的准确率优于通用及原始 BERT。
引用
@article{arxiv.2210.08284,
title = {AraLegal-BERT: A pretrained language model for Arabic Legal text},
author = {Muhammad AL-Qurishi and Sarah AlQaseemi and Riad Soussi},
journal= {arXiv preprint arXiv:2210.08284},
year = {2022}
}