中文

Racka:面向学术基础设施的高效匈牙利 LLM 适配

计算与语言 2026-02-13 v2

摘要

我们提出 Racka,一个轻量级、持续预训练的大型语言模型,旨在弥合匈牙利语等低资源语言与高资源语言(如英语和德语)之间的资源差距。Racka 通过 Low-Rank Adaptation(LoRA)实现参数高效的持续预训练,基于 Qwen-3 4B 主干模型,使配方在基于 A100(40GB)的 HPC 集群上具有实际操作性,且在低节点间带宽环境下也能运行。为更好匹配训练分布,我们替换并调整了标记化器,实现了对匈牙利语的显著增强标记化 fertility,同时保持对英语和德语的竞争性能。该模型基于混合了互联网和高质量精选来源的 1600 亿子词标记训练,数据组成为 44% 匈牙利语、24% 英语、21% 德语和 11% 代码。这种数据混合旨在缓解灾难性遗忘,同时在持续预训练期间保持高资源语言能力。我们的初步结果显示,语言适配呈现温和但稳定的改进。

关键词

引用

@article{arxiv.2601.01244,
  title  = {Racka: Efficient Hungarian LLM Adaptation on Academic Infrastructure},
  author = {Zsolt Csibi and Bence György Gortka and Natabara Gyöngyössy and Kornél Nagy and Dávid Márk Nemeskey and Martin Sallai and András Simonyi and András Márk Szekeres and Gábor Palkó},
  journal= {arXiv preprint arXiv:2601.01244},
  year   = {2026}
}

备注

22 pages, 1 figures. Appeared, and received best paper award, at the XXII. Magyar Sz\'am\'it\'og\'epes Nyelv\'eszeti Konferencia (MSZNY 2026)