中文

适配希伯来语:揭示增强词汇与指令能力的 DictaLM 2.0

计算与语言 2024-07-10 v1

摘要

在低资源语言(如希伯来语)中训练大语言模型(LLM)存在独特挑战。本文介绍了 DictaLM2.0 和 DictaLM2.0-Instruct 两个源自 Mistral 模型的大语言模型,这两个模型在希伯来语和英语语料上训练了约 2000 亿 tokens。将预训练模型适配到新语言涉及的专门技术,与从头训练或在资源丰富的英语等语言上进一步训练现有模型存在显著差异。我们概述了这些新颖的训练方法,促进了对希伯来语语言特性的有效学习与适应。此外,我们在全面指令数据集上微调了 DictaLM2.0-Instruct,以提升其在任务特定指令上的性能。为严格评估我们的模型,我们引入了一个新的希伯来语大语言模型评估基准套件,涵盖问答、情感分析、Winograd 模式挑战、翻译和摘要等多样化任务。我们的工作不仅解决了在低资源语言中训练大语言模型的复杂性,还提出了一个可用于适配其他大语言模型至各种非英语语言的框架,为多语言自然语言处理领域的发展作出了贡献。

关键词

引用

@article{arxiv.2407.07080,
  title  = {Adapting LLMs to Hebrew: Unveiling DictaLM 2.0 with Enhanced Vocabulary and Instruction Capabilities},
  author = {Shaltiel Shmidman and Avi Shmidman and Amir DN Cohen and Moshe Koppel},
  journal= {arXiv preprint arXiv:2407.07080},
  year   = {2024}
}