中文

SindBERT,帆船队:在土耳其 NLP 海上航行

计算与语言 2025-10-27 v1

摘要

Transformer 模型已彻底改变了 NLP,但许多形态丰富的语言在大规模预训练工作中仍然不被充分代表。以 SindBERT 为目标,我们为土耳其 NLP 绘制了航线,提供了第一个大规模基于 RoBERTa 的编码器。我们在 312 GB 的土耳其文本(mC4、OSCAR23、维基百科)上从头训练的 SindBERT,分别提供了 base 和 large 配置,代表了土耳其可用的最大规模编码器。我们在词性标注、命名实体识别、侮辱语言检测以及 TurBLiMP 语言可接受性基准上对 SindBERT 进行评估。我们的结果表明,SindBERT 在与现有土耳其和多语言模型的竞争中表现出竞争力,其中 large 变体在四个任务中的两个任务上取得最佳分数,但整体上显示出不一致的规模优势。这种平坦的规模趋势,也同样出现在 XLM-R 和 EuroBERT 上,表明当前的土耳其基准可能已经饱和。与此同时,与更小但更精选的模型如 BERTurk 的比较表明,语料库的质量和多样性可以超过粗粒度的数据量。综上所述,SindBERT 既作为土耳其 NLP 的开放资源,又作为关于规模极限以及形态丰富语言语料库组成在中心作用的实证案例研究。SindBERT 模型采用 MIT 许可证,并以 fairseq 和 Huggingface 格式发布。

关键词

引用

@article{arxiv.2510.21364,
  title  = {SindBERT, the Sailor: Charting the Seas of Turkish NLP},
  author = {Raphael Scheible-Schmitt and Stefan Schweter},
  journal= {arXiv preprint arXiv:2510.21364},
  year   = {2025}
}