中文

HEBATRON:以希伯来语为中心的开源稀疏 Mixture-of-Experts 语言模型

计算与语言 2026-05-13 v1

摘要

我们提出 Hebatron,一个基于 NVIDIA Nemotron-3 稀疏 Mixture-of-Experts 架构构建的希伯来语专用开源大语言模型。训练采用三阶段易到难的课程学习,配合持续的抗遗忘锚定,随后在 200 万对希伯来语-英语平行样本上进行监督微调。仅凭课程顺序排序即可实现约 3 分的综合基准提升。Hebatron 在希伯来语推理方面达到 73.8% 的平均得分,超越 DictaLM-3.0-24B-Thinking(68.9%),在 GSM8K-HE 和以色列 Trivia 任务上保持与 Gemma-3-27B-IT 的竞争力,同时仅在 300 亿参数模型中激活每次前向传播的 3B 参数,实现在原生上下文长度达到 65,536 token 时约 9 倍的推理吞吐量。据我们了解,这是首个针对任何目标语言对 Nemotron-3 架构进行语言特定适配,以及首个具原生长上下文支持的开源希伯来语专用 MoE 模型。模型权重公开发布,以支持希伯来语及 Semitic 语言 NLP 领域的进一步研究。

关键词

引用

@article{arxiv.2605.11255,
  title  = {HEBATRON: A Hebrew-Specialized Open-Weight Mixture-of-Experts Language Model},
  author = {Noam Kayzer and Dan Revital and Ori Bar Joseph and Smadar Arvatz and Or Levi and Tal Geva and Shaltiel Shmidman and Amir DN Cohen and Noam Ordan and Omer Baruch and Kate Zinkovskaia and Zevi Apini and Sarel Weinberger},
  journal= {arXiv preprint arXiv:2605.11255},
  year   = {2026}
}