中文

SnakModel:训练开源丹麦语大语言模型的经验教训

计算与语言 2024-12-18 v1

摘要

我们提出了SnakModel,一个基于Llama2-7B的丹麦语大语言模型(LLM),我们在136亿丹麦语单词上进行了持续预训练,并在370万丹麦语指令上进行了进一步微调。由于为较小语言社区创建LLM的最佳实践尚未建立,我们研究了早期建模和训练决策对整个训练流程下游性能的影响,包括:(1)从多种来源创建严格策划的丹麦语文本语料库;(2)语言建模和指令微调训练过程本身,包括中间训练动态分析和不同超参数的消融实验;(3)在八个语言和文化特定任务上的评估。在这些实验中,SnakModel取得了最高的整体性能,超越了多个当代基于Llama2-7B的模型。通过以开放许可形式公开SnakModel、我们的大部分预训练语料库以及相关代码,我们希望促进丹麦语自然语言处理的进一步研究和发展,并为具有类似资源限制的语言建立训练指南。

关键词

引用

@article{arxiv.2412.12956,
  title  = {SnakModel: Lessons Learned from Training an Open Danish Large Language Model},
  author = {Mike Zhang and Max Müller-Eberstein and Elisa Bassignana and Rob van der Goot},
  journal= {arXiv preprint arXiv:2412.12956},
  year   = {2024}
}

备注

Accepted at NoDaLiDa 2025 (oral)