Gl\'orIA -- 面向葡萄牙语的生成式开放大型语言模型
计算与语言
2024-02-21 v1 人工智能
摘要
自然语言任务取得了显著进展,这主要归功于强大大型语言模型 (LLM) 的出现。这些在广泛且多样的语料库上预训练的模型,越来越能够理解语言的复杂性。尽管许多高资源语言拥有丰富的 LLM,但此类模型在欧洲葡萄牙语中的可用性仍然有限。我们介绍了 Gl\'orIA,一个强大的欧洲葡萄牙语解码器 LLM。为了预训练 Gl\'orIA,我们组装了一个全面的 PT-PT 文本语料库,包含来自各种来源的 350 亿个 token。我们展示了我们的预训练方法,随后评估了该模型在多个下游任务上的有效性。此外,为了评估我们模型的语言建模能力,我们引入了 CALAME-PT(面向葡萄牙语的上下文感知语言建模评估),这是首个葡萄牙语零样本语言建模基准。评估显示,Gl\'orIA 在语言建模方面显著优于现有的开放 PT 解码器模型,并且能够生成合理、知识丰富且连贯的 PT-PT 文本。该模型在各种下游任务中也表现出巨大的潜力。
引用
@article{arxiv.2402.12969,
title = {Gl\'orIA -- A Generative and Open Large Language Model for Portuguese},
author = {Ricardo Lopes and João Magalhães and David Semedo},
journal= {arXiv preprint arXiv:2402.12969},
year = {2024}
}
备注
Accepted for publication at PROPOR 2024