NeoDictaBERT:推动 BERT 模型在希伯来语领域的前沿发展
计算与语言
2025-10-24 v1
摘要
自最初发布以来, BERT 模型在各种任务上都表现出色, 尽管其规模相对较小 (BERT-base 约有 1 亿参数)。然而, 这些模型的架构选择与最新的基于转换器的模型(如 Llama3 和 Qwen3)相比已显得过时。近期, 多个架构被提出以缩小这一差距。ModernBERT 和 NeoBERT 在英文基准测试上都表现出色, 并显著扩展了支持的上下文窗口。跟随其成功, 我们引入 NeoDictaBERT 和 NeoDictaBERT-bilingual: 使用与 NeoBERT 相同架构训练的 BERT 风格模型, 并专注于希伯来语文本。这些模型在几乎所有希伯来语基准测试上均优于现有模型, 为下游任务提供了强大的基础。值得注意的是, NeoDictaBERT-bilingual 模型在检索任务上表现出色, 在类似大小的其他多语言模型中均超越了竞争者。本文描述了训练过程并报告了各种基准测试结果。我们将模型发布给社区, 以推动希伯来语自然语言处理领域的研究与发展。
引用
@article{arxiv.2510.20386,
title = {NeoDictaBERT: Pushing the Frontier of BERT models for Hebrew},
author = {Shaltiel Shmidman and Avi Shmidman and Moshe Koppel},
journal= {arXiv preprint arXiv:2510.20386},
year = {2025}
}