中文

LLMic:罗马尼亚语基础语言模型

计算与语言 2025-01-15 v1

摘要

大型语言模型(LLM)的最新进展展示了其在各种任务中的卓越能力,其中商业模型处于领先地位。虽然开放模型通常在较小规模上运行,但它们通过专业化和微调保持了竞争力。然而,一个重大挑战依然存在:由于在训练语料库中的表示有限,开放模型在低资源语言中通常表现不佳。在本文中,我们提出了 LLMic,一个专门为罗马尼亚语设计的双语基础语言模型。我们记录了为低资源语言预训练基础模型的完整过程,包括语料库构建、架构选择和超参数优化。我们的评估表明,LLMic 可以专门用于目标语言的任务,取得与其他大得多的开放模型相当的结果。我们表明,在初始预训练阶段之后对 LLMic 进行语言翻译微调,在英译罗马尼亚语翻译任务中优于现有解决方案。这为罗马尼亚语社区使用小得多的 LLMic 模型进行高效大规模处理开辟了道路。

关键词

引用

@article{arxiv.2501.07721,
  title  = {LLMic: Romanian Foundation Language Model},
  author = {Vlad-Andrei Bădoiu and Mihai-Valentin Dumitru and Alexandru M. Gherghescu and Alexandru Agache and Costin Raiciu},
  journal= {arXiv preprint arXiv:2501.07721},
  year   = {2025}
}