利用 BERT 语言模型进行阿拉伯语长文档分类
计算与语言
2023-05-08 v1
摘要
鉴于全球阿拉伯语使用者的数量以及当今网络上在法律、医学甚至新闻等一些领域大量存在的内容,长度可观的文档被定期产生。使用传统学习模型对这些文档进行分类通常是不切实际的,因为文档的过长长度会将计算需求增加到不可持续的水平。因此,有必要专门针对长文本文档定制这些模型。在本文中,我们提出了两种简单但有效的模型来对长篇幅阿拉伯语文档进行分类。我们还针对同一任务微调了两种不同的模型——即 Longformer 和 RoBERT,并将其结果与我们的模型进行比较。在两种不同的数据集上,我们的两种模型均在此任务上优于 Longformer 和 RoBERT。
引用
@article{arxiv.2305.03519,
title = {Leveraging BERT Language Model for Arabic Long Document Classification},
author = {Muhammad AL-Qurishi},
journal= {arXiv preprint arXiv:2305.03519},
year = {2023}
}