中文

面向低资源语言的大语言模型指令化:以巴斯克语为例的系统性研究

计算与语言 2026-03-16 v3

摘要

通过用户意图指令化语言模型需要大规模指令数据集,而这些数据集仅限于有限的语言集合。在本文中,我们探讨了在低资源场景下常规指令适应管道的替代方案。我们假设低资源语言的现实场景,即仅能获得以下资源:目标语言的语料库、现有的开源多语言基础模型和已指令化的 backbone LLM,以及从指令化 backbone 中采样的人工生成指令。我们针对巴斯克语提出一套全面的实验体系,系统研究这些组件的不同组合,这些实验在包含 1,680 名参与者的基准测试和人类偏好上进行评估。我们的结论表明,目标语言语料库至关重要,人工生成指令可构建健壮模型,更重要的是,使用指令调优模型作为 backbone 优于使用 base 非指令化模型。我们通过将 backbone 扩展至 Llama 3.1 Instruct 70B,使模型接近巴斯克语规模更大的前沿模型,却无需任何巴斯克语指令。我们发布代码、模型、指令数据集和人类偏好,以支持未来研究在低资源语言适应的完全可重复性。https://github.com/hitz-zentroa/latxa-instruct

关键词

引用

@article{arxiv.2506.07597,
  title  = {Instructing Large Language Models for Low-Resource Languages: A Systematic Study for Basque},
  author = {Oscar Sainz and Naiara Perez and Julen Etxaniz and Joseba Fernandez de Landa and Itziar Aldabe and Iker García-Ferrero and Aimar Zabala and Ekhi Azurmendi and German Rigau and Eneko Agirre and Mikel Artetxe and Aitor Soroa},
  journal= {arXiv preprint arXiv:2506.07597},
  year   = {2026}
}

备注

Accepted at EMNLP 2025 Main Conference