基于渐进式词表扩展的大语言模型第二语言(阿拉伯语)习得
计算与语言
2025-10-02 v2
摘要
本文探讨了在阿拉伯世界普及大语言模型(LLM)的关键需求。由于主要侧重于主流语言(如英语和中文),该地区在开发与 GPT-4 或 ChatGPT 3.5 等最先进产品相媲美的模型方面进展较慢。阿拉伯语 LLM 的一个实际目标是为分词器使用阿拉伯语专用词表,从而加速解码。然而,使用不同的词表通常会导致已学知识的退化,因为在训练开始时许多词是词表外词(OOV)。受人类第二语言(阿拉伯语)习得过程中词汇学习的启发,已发布的 AraLLaMA 采用了渐进式词表扩展,这是通过一种改进的 BPE 算法实现的,该算法在训练过程中逐步扩展其动态词表中的阿拉伯语子词,从而在每个阶段平衡 OOV 比例。消融实验证明了渐进式词表扩展的有效性。此外,AraLLaMA 在各种阿拉伯语基准测试中取得了与最佳阿拉伯语 LLM 相当的优良性能。模型、训练数据、基准测试和代码将全部开源。
引用
@article{arxiv.2412.12310,
title = {Second Language (Arabic) Acquisition of LLMs via Progressive Vocabulary Expansion},
author = {Jianqing Zhu and Huang Huang and Zhihang Lin and Juhao Liang and Zhengyang Tang and Khalid Almubarak and Abdulmohsen Alharthik and Bang An and Juncai He and Xiangbo Wu and Fei Yu and Junying Chen and Zhuoheng Ma and Yuhao Du and He Zhang and Emad A. Alghamdi and Lian Zhang and Ruoyu Sun and Haizhou Li and Benyou Wang and Jinchao Xu},
journal= {arXiv preprint arXiv:2412.12310},
year = {2025}
}