中文

Vi-Mistral-X:通过高级持续预训练构建越南语语言模型

计算与语言 2024-03-26 v1

摘要

大语言模型(LLM)的进步显著改变了自然语言处理领域,尽管对以英语为中心的模型的关注造成了特定语言(包括越南语)的明显研究空白。为了解决这个问题,本文提出了vi-mistral-x,一个专为越南语设计的创新大语言模型。它利用了一种独特的持续预训练方法,基于Mistral架构,该架构融合了分组查询注意力和滑动窗口注意力技术。该模型vi-Mistral-X在提升越南语理解和生成方面迈出了重要一步。它引入了一个额外的持续预训练阶段,专门针对越南语进行调整,增强了模型理解复杂语言细微差别以及生成准确、上下文感知的越南语文本的能力。通过在多个基准上的全面测试,vi-mistral-x在文本分类、问答和文本生成等几个关键领域表现优于现有的越南语LLM。特别是在越南语多任务语言理解(VMLU)基准上,vi-mistral-x树立了新标准,显著优于其他可用模型。本文强调了持续预训练在推进特定语言LLM中的关键作用,并为多语言模型的发展开辟了新途径。我们希望vi-mistral-x不仅成为处理越南语的重要资产,还能鼓励为代表性不足的语言创建大语言模型方面取得更多进展。

关键词

引用

@article{arxiv.2403.15470,
  title  = {Vi-Mistral-X: Building a Vietnamese Language Model with Advanced Continual Pre-training},
  author = {James Vo},
  journal= {arXiv preprint arXiv:2403.15470},
  year   = {2024}
}

备注

The model is currently under development