中文

将 LLM 扩展至新语言:以 Llama 与波斯语适配为例

计算与语言 2025-01-09 v2

摘要

大型语言模型 (LLM) 在分类和文本生成任务中取得了巨大进展。然而,它们主要在英文数据上训练,在低资源语言上常常表现不佳。在本研究中,我们探索使用参数高效微调将一种新语言(即波斯语)添加到 Llama(一个对波斯语理解有限的模型)中。我们采用多阶段方法,包括在单语波斯语数据上进行预训练、通过双语预训练和指令数据集对齐表征,以及使用特定任务数据集进行指令微调。我们在每个阶段评估模型在生成和分类任务上的性能。研究结果表明,通过双语数据对齐引入波斯语,可以提高波斯语任务的分类准确率,且对英文任务没有负面影响,有时甚至有所提升。此外,结果强调,在训练数据有限时,模型的初始能力是一个关键因素,而跨语言对齐对低资源语言的益处微乎其微。从英文到波斯语的知识迁移效果甚微,主要对简单的分类任务有益。

关键词

引用

@article{arxiv.2412.13375,
  title  = {Extending LLMs to New Languages: A Case Study of Llama and Persian Adaptation},
  author = {Samin Mahdizadeh Sani and Pouya Sadeghi and Thuy-Trang Vu and Yadollah Yaghoobzadeh and Gholamreza Haffari},
  journal= {arXiv preprint arXiv:2412.13375},
  year   = {2025}
}

备注

accepted at COLING 2025