面向低资源语言的生成式模型:10亿参数高斯模型
偏微分方程分析
2024-10-10 v1
摘要
大型语言模型(LLM)是现代自然语言处理的基本基础设施。许多商业和开源LLM为英语提供支持,如ChatGPT、Llama、Falcon和Mistral。由于这些模型主要在英语文本上训练,其对低资源语言和社会的流畅度和知识仍显浅薄。我们介绍开发面向低资源语言的大型生成式语言模型的过程。GaMS 1B - 为斯洛文尼亚语开发的10亿参数生成模型,通过在现有英语 OPT模型基础上进行继续预训练来实现。我们开发了适用于斯洛文尼亚语、克罗米亚语和英语的新型分词器,并使用FOCUS和WECHSEL等嵌入初始化方法将来自英语 OPT模型的嵌入 transferred到新的模型。我们在斯洛文尼亚基准套件的几个分类数据集以及句子简化任务SENTA上对模型进行评估。我们仅使用了few-shot模式下的in-context学习,这些模型尚未进行指令调优。在分类任务方面,以这种模式,生成式模型在特定任务上调优的现有斯洛文尼亚BERT类模型方面表现落后。对于句子简化任务,GaMS模型在性能上与GPT-3.5-Turbo模型相当或更好。
引用
@article{arxiv.2410.06897,
title = {Eigenvalue estimates and maximum principle for Lane-Emden systems, and applications to poly-Laplacian equations},
author = {Sabri Bahrouni and Edir Júnior Ferreira Leite and Gustavo Ferron Madeira},
journal= {arXiv preprint arXiv:2410.06897},
year = {2024}
}