Dicta-LM 3.0:以希伯来语主权大模型为目标,推动前沿发展
计算与语言
2026-02-03 v1
摘要
前沿实验室已发布开源大型语言模型(LLM),但针对非英语语言的主权大型语言模型(Sovereign LLMs)供应稀缺而需求极高。为低资源语言如希伯来语训练大型语言模型具有独特挑战。本文介绍Dicta-LM 3.0:一个在希伯来语和英语文本语料库上进行大规模训练的开源LLM集合。该模型提供三个规模:24B参数版本基于Mistral-Small-3.1基础模型,12B参数版本基于NVIDIA Nemotron Nano V2模型,1.7B参数版本基于Qwen3-1.7B基础模型。我们发布了每个模型的多个变体,均支持原生65k token上下文长度;包括基础模型和带工具调用支持的聊天模型。为严格评估我们的模型,我们引入了一个新的基准套件,用于评估希伯来语聊天类LLM,涵盖翻译、摘要、沃森格测试、以色列博学问答和希伯来文 diacritization(nikud)等多样化任务。我们的工作不仅解决了低资源语言LLM训练的技术难题,还提出了一种可复用的框架,为适配其他非英语语言提供了可行方案,为多语言NLP领域的发展作出了贡献。
引用
@article{arxiv.2602.02104,
title = {Dicta-LM 3.0: Advancing The Frontier of Hebrew Sovereign LLMs},
author = {Shaltiel Shmidman and Avi Shmidman and Amir DN Cohen and Moshe Koppel},
journal= {arXiv preprint arXiv:2602.02104},
year = {2026}
}