小语言,大模型:挪威语言持续训练研究
计算与语言
2025-02-04 v2
摘要
训练大型语言模型需要大量数据,这对使用范围较小的语言(如挪威语)构成挑战,对真正低资源语言(如北萨米语)则更是如此。为了解决这一问题,我们提出了一种新颖的三阶段持续训练方法,显著提升了目标语言的下游性能以及推理效率。基于我们的发现,我们训练、评估并公开发布了一个新的生成式语言模型NorMistral-11B,包含114亿参数,覆盖挪威Bokmål语、Nynorsk语和北萨米语。
引用
@article{arxiv.2412.06484,
title = {Small Languages, Big Models: A Study of Continual Training on Languages of Norway},
author = {David Samuel and Vladislav Mikhailov and Erik Velldal and Lilja Øvrelid and Lucas Georges Gabriel Charpentier and Andrey Kutuzov and Stephan Oepen},
journal= {arXiv preprint arXiv:2412.06484},
year = {2025}
}
备注
Published at NoDaLiDa 2025