TabiBERT:大规模 ModernBERT 基础模型与土耳其语统一基准
计算与语言
2026-01-06 v3
摘要
自 BERT 诞生以来,纯编码器 Transformer 在计算效率、训练稳定性和长上下文建模方面取得了显著进展。ModernBERT 通过集成旋转位置编码、FlashAttention 和改进的归一化整合了这些进展。尽管有这些发展,土耳其语 NLP 仍缺乏从头训练并融合此类现代架构范式的单语编码器。本工作引入了 TabiBERT,这是一种基于 ModernBERT 架构、在大型精选语料库上从头训练的单语土耳其语编码器。TabiBERT 在从 84.88B token 的多领域语料库中采样的 1 万亿 token 上进行了预训练:网络文本 (73%)、科学出版物 (20%)、源代码 (6%) 和数学内容 (0.3%)。它支持 8,192-token 的上下文长度(原始 BERT 的 16 倍),实现了高达 2.65 倍的推理加速,并降低了 GPU 显存消耗,从而支持更大的批处理规模。我们引入了 TabiBench,包含涵盖八个任务类别的 28 个数据集,具有标准化的划分与协议,并采用 GLUE 风格的宏平均进行评估。TabiBERT 在 TabiBench 上取得 77.58 分,比 BERTurk 高出 1.62 分,并在八个类别中的五个类别上确立了 SOTA,在问答 (+9.55 分)、代码检索 (+2.41 分) 和学术理解 (+0.66 分) 方面增益尤为显著。与包括 TurkishBERTweet 等专用模型在内的特定任务先前最佳结果相比,TabiBERT 实现了 +1.47 的平均提升,表明其具有稳健的跨领域泛化能力。我们发布了模型权重、训练配置和评估代码,以促进透明、可复现的土耳其语编码器研究。
引用
@article{arxiv.2512.23065,
title = {TabiBERT: A Large-Scale ModernBERT Foundation Model and A Unified Benchmark for Turkish},
author = {Melikşah Türker and A. Ebrar Kızıloğlu and Onur Güngör and Susan Üsküdarlı},
journal= {arXiv preprint arXiv:2512.23065},
year = {2026}
}
备注
33 pages, 2 figures, 13 tables