面向资源受限Arabic LLM创建:模型适配、集成与多域测试
计算与语言
2024-12-24 v1 人工智能
摘要
本文提出了一种 novel 方法,用于使用QLoRA在仅有4GB VRAM的系统上对Qwen2-1.5B模型进行阿拉伯语语言处理的微调。我们详细描述了将大型语言模型适配到阿拉伯语领域的过程,采用包括Bactrian、OpenAssistant和维基百科阿拉伯语语料库等多样化数据集。我们的 methodology 包括自定义数据预处理、模型配置和训练优化技术,如梯度累积和混合精度训练。我们解决了阿拉伯语NLP中的特定挑战,包括形态复杂度、方言变异和元音标记处理。经过10,000个训练步骤的实验结果显示,性能显著提升,最终损失收敛至0.1083。我们提供了关于GPU内存使用、训练动力学以及在各种阿拉伯语语言任务(包括文本分类、问答和方言识别)上的模型评估的全面分析。微调后的模型对输入扰动表现出鲁棒性,并 improved 处理阿拉伯语特定语言现象。该研究通过演示一种面向资源受限环境的创建专业语言模型的方法,推动了多语言AI的发展,可能 democratize 对多样化语言社区先进 NLP 技术的获取。我们的工作为低资源语言适应和大型语言模型高效微调的未来研究之路。
关键词
引用
@article{arxiv.2412.17548,
title = {Resource-Aware Arabic LLM Creation: Model Adaptation, Integration, and Multi-Domain Testing},
author = {Prakash Aryan},
journal= {arXiv preprint arXiv:2412.17548},
year = {2024}
}