中文

Sabiá:葡萄牙语大语言模型

计算与语言 2023-11-10 v4 人工智能

摘要

随着语言模型能力的持续进步,可以想见“一刀切”模型仍将作为主要范式。例如,鉴于全球语言数量庞大且许多为低资源语言,普遍做法是在多种语言上预训练单一模型。本文补充了日益增多的质疑该做法的证据,证明在目标语言上进行单语预训练能显著改进已在多样语料上广泛训练的模型。更具体地,我们使用不超过原始预训练预算3%的葡萄牙语文本进一步预训练GPT-J和LLaMA模型。在Poeta(一套14个葡萄牙语数据集)上的少样本评估显示,我们的模型大幅优于以英语为中心和多语对的对应模型。我们最佳的模型Sabiá-65B性能与GPT-3.5-turbo相当。通过在原生于目标语言及翻译得到的数据集上评估,我们研究了语言特定预训练在以下方面的贡献:1)捕捉目标语言固有的语言细微差别与结构,2)丰富模型关于某领域或文化的知识。结果表明,大部分收益源于通过单语预训练获得的领域特定知识。

关键词

引用

@article{arxiv.2304.07880,
  title  = {Sabi\'a: Portuguese Large Language Models},
  author = {Ramon Pires and Hugo Abonizio and Thales Sales Almeida and Rodrigo Nogueira},
  journal= {arXiv preprint arXiv:2304.07880},
  year   = {2023}
}