Llama-GENBA-10B:面向德语、英语和巴伐利亚语的三语大语言模型
计算与语言
2025-09-09 v1 人工智能
摘要
我们提出Llama-GENBA-10B,一款针对英语中心偏见的大语言模型。基于Llama 3.1-8B扩展至10B参数,Llama-GENBA-10B在1640亿标记上持续预训练(820亿英语、820亿德语和8000万巴伐利亚语),在资源分配上保持平衡,防止英语主导。针对德语NLP社区,本模型还促进了巴伐利亚语作为低资源语言的发展。开发过程中克服了四个挑战:(1)在巴伐利亚语稀缺的情况下构建多语言语料库,(2)为英语、德语和巴伐利亚语创建统一的tokenizer,(3)针对跨语言迁移优化架构和语言比率超参数,(4)建立第一个标准化的三语评估套件,通过将德语基准翻译为巴伐利亚语。评估结果表明,Llama-GENBA-10B在跨语言性能方面表现出色,经过微调的变体在巴伐利亚语方面超越Apertus-8B-2509和gemma-2-9b,在该语言中 establishing itself as the best model in its class,同时在英语中超越EuroLLM,在德语中与之相当。使用Cerebras CS-2进行训练,证明了大规模多语言预训练的高效性,并记录了能源使用情况,为集成低资源语言的包容性基础模型提供了蓝图。
引用
@article{arxiv.2509.05668,
title = {Llama-GENBA-10B: A Trilingual Large Language Model for German, English and Bavarian},
author = {Michael Hoffmann and Jophin John and Stefan Schweter and Gokul Ramakrishnan and Hoi-Fong Mak and Alice Zhang and Dmitry Gaynullin and Nicolay J. Hammer},
journal= {arXiv preprint arXiv:2509.05668},
year = {2025}
}
备注
Michael Hoffmann and Jophin John contributed equally to this work