中文

基于预训练Transformer的阿拉伯语问答方法:一项比较研究

计算与语言 2025-08-06 v2

摘要

问答(QA)是自然语言处理(NLP)中最具挑战性却也被广泛研究的问题之一。问答系统试图为给定问题生成答案。这些答案可由非结构化或结构化文本生成。因此,QA被视为可用于评估文本理解系统的重要研究领域。大量QA研究致力于英语,探究最先进的技术并取得SOTA结果。然而,由于阿拉伯语QA研究努力的匮乏及缺乏大型基准数据集,阿拉伯语问答进展明显较慢。近来许多预训练语言模型在诸多阿拉伯语NLP问题上提供了高性能。本工作中,我们使用Arabic-SQuAD、ARCD、AQAD与TyDiQA-GoldP四个阅读理解数据集评估了用于阿拉伯语QA的SOTA预训练Transformer模型。我们对AraBERTv2-base、AraBERTv0.2-large与AraELECTRA模型的性能进行了微调与比较。最后,我们提供分析以理解并解释某些模型获得的低性能结果。

关键词

引用

@article{arxiv.2111.05671,
  title  = {Pre-trained Transformer-Based Approach for Arabic Question Answering : A Comparative Study},
  author = {Kholoud Alsubhi and Amani Jamal and Areej Alhothali},
  journal= {arXiv preprint arXiv:2111.05671},
  year   = {2025}
}

备注

Rewrite the paper