通过跨语言知识迁移教授Llama一种新语言
计算与语言
2024-07-03 v1
摘要
本文探讨了将预训练大型语言模型(LLM)适应到新低资源语言的方法,其中特别关注爱沙尼亚语。利用Llama 2模型,我们研究了将跨语言指令微调与额外单语预训练相结合的影响。我们的实验结果表明,即使仅进行少量额外的单语预训练,然后进行跨语言指令微调,也能显著提升爱沙尼亚语的性能。此外,我们展示了从高质量英语指令到爱沙尼亚语的跨语言知识迁移,显著提升了常识推理和多轮对话能力。我们的顶尖模型命名为Scientists Llama(\textsc{Llammas}),是首个开源的爱沙尼亚语指令跟随型LLM。我们还发布了Alpaca-est,这是爱沙尼亚语的首个通用任务指令数据集。这些贡献标志着在爱沙尼亚语开源LLM开发方向上的初始进展。
引用
@article{arxiv.2404.04042,
title = {Teaching Llama a New Language Through Cross-Lingual Knowledge Transfer},
author = {Hele-Andra Kuulmets and Taido Purason and Agnes Luhtaru and Mark Fishel},
journal= {arXiv preprint arXiv:2404.04042},
year = {2024}
}