MiniLingua:面向欧洲语言的小型开源大语言模型
计算与语言
2025-12-16 v1 人工智能
摘要
大型语言模型虽强大,但往往受限于高计算成本、隐私 concerns 以及以英语为中心的训练。近期进展表明,约一亿参数的小型高效模型可实现卓越效果并支持端侧使用。本文介绍 MiniLingua,一个为 13 种欧洲语言从零训练的百万参数开源大语言模型,旨在平衡覆盖范围与指令跟随能力。基于评估结果,MiniLingua 的指令调优版本在摘要生成、分类以及开放式和封闭式问答任务上超越了 EuroLLM(一个采用类似训练方法但拥有更大训练预算的数据集),此外,在开放式生成任务上仍与更高级的 SOTA 模型保持竞争力。我们发布模型权重、tokenizer 以及用于数据处理和模型训练的源代码。
引用
@article{arxiv.2512.13298,
title = {MiniLingua: A Small Open-Source LLM for European Languages},
author = {Anna Aksenova and Boris Zverkov and Nicola Dainese and Alexander Nikitin and Pekka Marttinen},
journal= {arXiv preprint arXiv:2512.13298},
year = {2025}
}
备注
9+6 pages, 6 figures and 3 tables in the main text. Code at https://github.com/MiniLingua-ai/training_artifacts