中文

Poro 34B 及其多语言之恩

计算与语言 2025-06-11 v3

摘要

state-of-the-art 大型语言模型的预训练现在需要数千亿单词的文本,这远超大多数语言可用数据的数量。虽然包含多于一种语言的文本是获取更多预训练数据的明显方式,但多语言性通常被视为诅咒,大多数模型训练工作仍专注于单个大语言。我们认为,多语言性可以是一种恩惠:当目标语言训练更大模型时数据不足成为约束时,augmenting 其他语言的数据可提供一种超越单语模型能力的方法。本研究介绍Poro 34B,一个在芬兰语、英语和编程语言上使用1万亿token进行训练的340亿参数模型,证明了多语言训练方法可以显著提升现有模型在芬兰语的能力,并在翻译方面表现出色,同时在英语和编程语言方面实现其类别的竞争性能。我们在https://huggingface.co/LumiOpen/Poro-34B发布模型参数、脚本和数据,遵循开放许可。

关键词

引用

@article{arxiv.2404.01856,
  title  = {Poro 34B and the Blessing of Multilinguality},
  author = {Risto Luukkonen and Jonathan Burdge and Elaine Zosa and Aarne Talman and Ville Komulainen and Väinö Hatanpää and Peter Sarlin and Sampo Pyysalo},
  journal= {arXiv preprint arXiv:2404.01856},
  year   = {2025}
}