探索分词策略与词表大小以增强阿拉伯语语言模型
计算与语言
2024-09-23 v2
摘要
本文全面考察了分词策略和词表大小对阿拉伯语语言模型在下游自然语言处理任务中性能的影响。我们的研究集中在四种分词器在各种任务中的有效性,包括新闻分类、仇恨言论检测、情感分析和自然语言推理。利用多种词表大小,我们仔细审查了分词方法与模型性能之间复杂的相互作用。结果表明,结合 Farasa 的 Byte Pair Encoding (BPE) 在多项任务中优于其他策略,凸显了形态学分析在捕捉阿拉伯语细微差别中的重要性。然而,在情感分析中出现了挑战,特定于方言的分割问题影响了模型效率。计算效率分析证明了结合 Farasa 的 BPE 的稳定性,表明了其实际可行性。我们的研究表明,在保持模型大小不变的情况下,词表大小对模型性能的影响有限。这挑战了关于词表、模型大小和下游任务之间关系的既有观念,强调了需要研究模型大小及其相应的词表大小,以实现跨领域的泛化并减轻偏差,尤其是在基于方言的数据集中。论文的建议包括改进分词策略以应对方言挑战,增强模型在不同语言环境下的鲁棒性,以及扩展数据集以涵盖丰富的基于方言的阿拉伯语。这项工作不仅推进了我们对阿拉伯语语言模型的理解,也为针对阿拉伯语复杂性量身定制的自然语言处理技术的负责任和合乎伦理的发展奠定了基础。
引用
@article{arxiv.2403.11130,
title = {Exploring Tokenization Strategies and Vocabulary Sizes for Enhanced Arabic Language Models},
author = {Mohamed Taher Alrefaie and Nour Eldin Morsy and Nada Samir},
journal= {arXiv preprint arXiv:2403.11130},
year = {2024}
}