UrduLLaMA 1.0:低资源环境下的数据集构建、预处理与评估
计算与语言
2025-02-25 v1 人工智能
摘要
多语言大语言模型(LLMs)在乌尔都语等低资源语言上通常表现欠佳。本文介绍了 UrduLLaMA 1.0,该模型基于开源的 Llama-3.1-8B-Instruct 架构,并在 1.28 亿个乌尔都语 token 上进行持续预训练,从而捕捉该语言的丰富多样性。为增强指令遵循与翻译能力,我们利用低秩适应在 41,000 条乌尔都语指令及约 50,000 对英乌翻译数据上对模型进行微调。在三个机器翻译数据集上的评估表明,与最先进的(SOTA)模型相比取得了显著的性能提升,为乌尔都语 LLMs 设定了新的基准。这些发现凸显了在有限数据和计算资源下,采用针对性适配策略以应对低资源语言独特挑战的潜力。
引用
@article{arxiv.2502.16961,
title = {UrduLLaMA 1.0: Dataset Curation, Preprocessing, and Evaluation in Low-Resource Settings},
author = {Layba Fiaz and Munief Hassan Tahir and Sana Shams and Sarmad Hussain},
journal= {arXiv preprint arXiv:2502.16961},
year = {2025}
}