中文

面向马其顿语的开放基础语言模型与语料库:一项低资源语言研究

计算与语言 2025-10-13 v1

摘要

全球技术采纳的增加带来了对大众可使用新型工具的需求。大语言模型(LLM)在这方面提供了巨大机遇,但其能力对低资源语言仍然有限,限制了在这些语言使用国家的应用。我们创建了多种资源以促进 LLM 的采用并支持马其顿语的研究进展。我们收集了迄今为止最大的马其顿语语料库,包含 40GB 文本数据,共计 35 亿词。为了支持对话应用,我们收集了一个包含 106k 条指令的数据集,经过精心构建以立足当地文化。为评估,我们构建了一个覆盖七个基准的马其顿语评估套件。最后,我们在精心策划的数据集上训练了 domestic-yak——一个最先进的 8B 参数模型——并使用新构建的基准套件对八个基线模型进行了评估。我们的模型在所有基准上均超越了 8B 参数范围内的所有现有模型,并达到了与最大 10 倍参数规模模型相当的性能。此外,与母语者的定性分析显示我们的模型更受青睐,在语法正确性和文化适宜性方面获得了更高评分。所有数据集、代码和模型权重均公开发布,为推进类似代表性不足语言中的 LLM 研究奠定了基础。这些资源在 github.com/LVSTCK(源代码)和 huggingface.co/LVSTCK(预训练模型权重和数据)上公开可用。

关键词

引用

@article{arxiv.2506.09560,
  title  = {Towards Open Foundation Language Model and Corpus for Macedonian: A Low-Resource Language},
  author = {Stefan Krsteski and Matea Tashkovska and Borjan Sazdov and Hristijan Gjoreski and Branislav Gerazov},
  journal= {arXiv preprint arXiv:2506.09560},
  year   = {2025}
}

备注

Camera-ready version accepted at SlavNLP-2025@ACL