中文

MrBERT:通过词汇、领域和维度适配实现现代多语言编码器

计算与语言 2026-03-10 v2 人工智能 机器学习

摘要

我们提出 MrBERT,一个基于 ModernBERT 架构构建的 1.5 至 3 亿参数编码器族,预训练于 35 种语言和代码。通过有针对性的适应,该模型族在加泰罗尼亚语和西班牙语专用任务上实现了最先进的成绩,同时在特定生物医学和法律领域建立了稳健的性能。为弥合研究与生产之间的差距,我们引入 Matryoshka 表示学习 (MRL),实现可调向量大小,显著降低推理和存储成本。最终,MrBERT 模型族表明,现代编码器架构可针对本地化语言卓越性和高风险领域专业化进行优化。我们将完整的模型族在 Huggingface 上开源。

关键词

引用

@article{arxiv.2602.21379,
  title  = {MrBERT: Modern Multilingual Encoders via Vocabulary, Domain, and Dimensional Adaptation},
  author = {Daniel Tamayo and Iñaki Lacunza and Paula Rivera-Hidalgo and Severino Da Dalt and Javier Aula-Blasco and Aitor Gonzalez-Agirre and Marta Villegas},
  journal= {arXiv preprint arXiv:2602.21379},
  year   = {2026}
}

备注

24 pages, 14 tables and 4 figures