EuroBERT:面向欧洲语言扩展多语言编码器
计算与语言
2025-03-28 v2 人工智能
摘要
用于检索、回归和分类的通用多语言向量表示,传统上由双向编码器模型获得。尽管编码器具有广泛的适用性,但最近被生成式纯解码器模型的进展所掩盖。然而,推动这一进展的许多创新并非本质上与解码器绑定。在本文中,我们通过这些进展的视角重新审视多语言编码器的开发,并引入了 EuroBERT,这是一个涵盖欧洲及广泛使用的全球语言的多语言编码器家族。我们的模型在跨越多语言能力、数学和编程的广泛任务中优于现有替代方案,并原生支持长达 8,192 个 token 的序列。我们还审视了 EuroBERT 背后的设计决策,提供了关于我们数据集构成和训练流程的见解。我们公开发布了 EuroBERT 模型,包括中间训练检查点,以及我们的训练框架。
引用
@article{arxiv.2503.05500,
title = {EuroBERT: Scaling Multilingual Encoders for European Languages},
author = {Nicolas Boizard and Hippolyte Gisserot-Boukhlef and Duarte M. Alves and André Martins and Ayoub Hammal and Caio Corro and Céline Hudelot and Emmanuel Malherbe and Etienne Malaboeuf and Fanny Jourdan and Gabriel Hautreux and João Alves and Kevin El-Haddad and Manuel Faysse and Maxime Peyrard and Nuno M. Guerreiro and Patrick Fernandes and Ricardo Rei and Pierre Colombo},
journal= {arXiv preprint arXiv:2503.05500},
year = {2025}
}
备注
28 pages, 8 figures, 13 tables