为资源较少的语言构建强大的指令语言模型
计算与语言
2026-03-03 v1 机器学习
摘要
大型语言模型(LLM)已成为自然语言处理和人工智能领域的重要工具。当前的开源模型主要在英文文本上训练,导致在资源较少的语言和文化方面的表现较差。我们提出一套必要的方法论,用于成功地将 LLM 适应资源较少的语言,并以 Slovene 语言为例进行演示。我们 presented GaMS3-12B,一个具有 120 亿参数的斯洒文语义生成模型,证明它是该参数范围内最好的开源斯洒文语言模型。我们通过对 Gemma 3 模型进行三个阶段的持续预训练, followed by two-stage supervised fine-tuning (SFT) 来适应斯洒文语言。我们在 1400 亿斯洒文、英语、波斯尼亚语、塞尔维亚语和克罗地亚语 pretraining token 以及 20 万英语和斯洒文 SFT 示例上进行训练。我们在斯洒文-LLM-Eval 数据集、英语到斯洒文翻译以及斯洒文 LLM 竞技场上评估 GaMS3-12B。我们表明,所描述的模型在所有三个场景中均优于 120 亿参数的 Gemma 3,并在斯洒文 LLM 竞技场中表现出与更大型商业模型 GPT-4o 相当, achieving a win rate of over 60%。
引用
@article{arxiv.2603.01691,
title = {Building a Strong Instruction Language Model for a Less-Resourced Language},
author = {Domen Vreš and Tjaša Arčon and Timotej Petrič and Dario Vajda and Marko Robnik-Šikonja and Iztok Lebar Bajec},
journal= {arXiv preprint arXiv:2603.01691},
year = {2026}
}
备注
Currently under review at Natural Language Processing Special Issue on Language Models for Low-Resource Languages