中文

LLäMmlein:透明、紧凑且具竞争力的从零开始训练的纯德语语言模型

计算与语言 2025-06-19 v5 人工智能 机器学习

摘要

我们透明地从零开始创建了两个纯德语解码器模型 LLäMmlein 120M 和 1B,并将其与训练数据一同发布,供德国自然语言处理研究社区使用。模型训练涉及几个关键步骤,包括广泛的数据预处理、创建自定义德语分词器、训练本身,以及在各种基准上评估最终模型。在整个训练过程中,我们保存了多个检查点,并使用 SuperGLEBer 基准进行分析,以监控模型的学习动态。与 SuperGLEBer 基准上的最先进模型相比,两个 LLäMmlein 模型都表现出竞争力,持续匹配或超越了具有相似参数规模的模型。结果表明,模型的质量如预期般随规模扩展,但在某些任务上的性能提升较早趋于平稳,这为未来模型开发的资源分配提供了宝贵的见解。

关键词

引用

@article{arxiv.2411.11171,
  title  = {LL\"aMmlein: Transparent, Compact and Competitive German-Only Language Models from Scratch},
  author = {Jan Pfister and Julia Wunderle and Andreas Hotho},
  journal= {arXiv preprint arXiv:2411.11171},
  year   = {2025}
}

备注

camera ready @ACL25; https://www.informatik.uni-wuerzburg.de/datascience/projects/nlp/llammlein/