中文

利用预训练语言模型支持无点阿拉伯文

计算与语言 2021-11-19 v1 机器学习

摘要

我们观察到社交媒体上近期的一种现象:用户故意去除阿拉伯字母上的辅音点,以绕过内容分类算法。内容分类通常通过微调预训练语言模型来完成,这类模型近来已被许多自然语言处理应用所采用。在本工作中,我们研究将预训练阿拉伯语语言模型应用于“无点”阿拉伯文本的效果。我们提出了若干无需额外训练即可用预训练模型支持无点文本的方法,并在两个阿拉伯语自然语言处理下游任务上衡量其性能。结果令人鼓舞;在其中一个任务上,我们的方法表现出近乎完美的性能。

关键词

引用

@article{arxiv.2111.09791,
  title  = {Supporting Undotted Arabic with Pre-trained Language Models},
  author = {Aviad Rom and Kfir Bar},
  journal= {arXiv preprint arXiv:2111.09791},
  year   = {2021}
}

备注

Paper accepted to 4th International Conference on Natural Language and Speech Processing (ICNLSP 2021)