中文

在阿拉伯语推文上预训练BERT:实践考量

计算与语言 2021-02-23 v1 人工智能

摘要

为下游NLP任务预训练来自Transformer的双向编码器表示(BERT)是一项非平凡任务。我们预训练了5个BERT模型,它们在训练集规模、正式与非正式阿拉伯语的混合比例以及语言预处理方面有所不同。所有这些模型均旨在支持阿拉伯语方言和社交媒体。实验突出了数据多样性的核心地位以及具备语言感知的分词的有效性。它们也表明更多数据或更多训练步并不一定带来更好的模型。我们的新模型在若干下游任务上取得了新的最先进结果。所得模型以 QARiB 之名发布给社区。

关键词

引用

@article{arxiv.2102.10684,
  title  = {Pre-Training BERT on Arabic Tweets: Practical Considerations},
  author = {Ahmed Abdelali and Sabit Hassan and Hamdy Mubarak and Kareem Darwish and Younes Samih},
  journal= {arXiv preprint arXiv:2102.10684},
  year   = {2021}
}

备注

6 pages, 5 figures