中文

Mecellem 模型:为法律领域从头训练与持续预训练的土耳其语模型

计算与语言 2026-01-23 v1

摘要

本文提出了 Mecellem 模型,这是一个通过领域适应策略为土耳其法律领域开发专用语言模型的框架。我们做出了两项贡献:(1) 从头预训练的编码器模型:基于 ModernBERT 的双向编码器,在一个包含 1127 亿词元的土耳其语主导语料库上进行了预训练。我们实施了一种检查点选择策略,该策略在训练过程中评估下游检索性能,揭示了最优检查点在预训练损失达到最小值之前就取得了最佳检索分数。我们的编码器模型在土耳其语检索排行榜上取得了前三名的排名,较小的模型(1.55 亿参数)取得了与较大的参考模型(3.07 亿至 5.67 亿参数)相当的性能。与最先进的模型(embeddinggemma-300m: 100.00%, BAAI/bge-m3: 99.54%, newmindai/bge-m3-stsb: 94.38%)相比,我们的方法实现了 92.36% 的生产效率,尽管需要较少的计算资源,但总体排名第四。最先进的模型依赖于多阶段、计算密集型的训练流程,使得我们的单阶段预训练后接高效后训练的方法成为一种具有成本效益的替代方案;(2) 采用持续预训练的编码器模型:通过受控的课程学习,将 Qwen3-1.7B 和 Qwen3-4B 模型适应于土耳其法律领域。具有最优样本比例的四阶段持续预训练,实现了从通用语言知识到专业法律术语和长上下文推理的逐步过渡。该方法在土耳其法律文本上实现了 36.2% 的困惑度降低,展示了领域适应的收益。

关键词

引用

@article{arxiv.2601.16018,
  title  = {Mecellem Models: Turkish Models Trained from Scratch and Continually Pre-trained for the Legal Domain},
  author = {Özgür Uğur and Mahmut Göksu and Mahmut Çimen and Musa Yılmaz and Esra Şavirdi and Alp Talha Demir and Rumeysa Güllüce and İclal Çetin and Ömer Can Sağbaş},
  journal= {arXiv preprint arXiv:2601.16018},
  year   = {2026}
}

备注

16 png, 1 tex, 1 bib