中文

TildeOpen LLM:利用课程学习实现语言表示的公平性

计算与语言 2026-04-30 v2 人工智能

摘要

大型语言模型在许多欧洲语言上表现不佳,这是由于英语和少数几种高资源语言在训练数据中的主导地位所致。本文提出TildeOpen LLM,一个拥有300亿参数的开放权重基础模型,针对34种欧洲语言进行训练,以促进语言公平性并提高低资源语言的性能。为解决数据不平衡问题,我们将数据上采样与基于课程的训练计划相结合,该计划在均匀分布和自然语言分布之间交替进行。该模型尽管使用的数据计算资源显著少于其他多语言LLM,却在多个多语言基准测试中表现出竞争力。评估结果显示,TildeOpen在文本生成和理解方面优于现有开放权重模型,尤其是对巴尔蒂语、芬兰乌拉语和斯拉夫语语言表现更好。人类评估确认,其在主要基线方法中的语言错误率降低了最高可达十倍。该模型及相关资源全部为开放权重,并可在huggingface.co/TildeAI/TildeOpen-30b上公开获取。这些结果表明,精心的数据策划和平衡的训练策略可以在不增加模型规模或训练量的前提下,显著提升多语言模型质量。

关键词

引用

@article{arxiv.2603.08182,
  title  = {TildeOpen LLM: Leveraging Curriculum Learning to Achieve Equitable Language Representation},
  author = {Toms Bergmanis and Martins Kronis and Ingus Jānis Pretkalniņš and Dāvis Nicmanis and Jeļizaveta Jelinska and Roberts Rozis and Rinalds Vīksna and Mārcis Pinnis},
  journal= {arXiv preprint arXiv:2603.08182},
  year   = {2026}
}

备注

LREC 2026