中文

芬兰语 ModernBERT 预训练

计算与语言 2025-11-13 v1

摘要

本文报告了在六种不同大小(从 5100 万到 4.75 亿参数)的 ModernBERT 编码器模型上进行的预训练,重点关注有限的多语言性,强调与芬兰相关的语言。我们的模型在与现有多语言模型竞争或优于的同时,在需要超过 512 个标记上下文的任务上表现优于单语言模型。我们呈现了使用不同数据在最终训练阶段的实证结果。代码和模型已公开发布。

关键词

引用

@article{arxiv.2511.09213,
  title  = {Pretraining Finnish ModernBERTs},
  author = {Akseli Reunamo and Laura-Maria Peltonen and Hans Moen and Sampo Pyysalo},
  journal= {arXiv preprint arXiv:2511.09213},
  year   = {2025}
}