中文

PAGnol:一个超大型法语生成模型

计算与语言 2022-10-26 v1

摘要

获取多种架构、多种语言的大型预训练模型,是NLP民主化的核心。我们介绍了PAGnol,一个法语GPT模型集合。利用缩放定律,我们以与CamemBERT(一个小13倍的模型)相同的计算预算高效训练了PAGnol-XL(15亿参数)。PAGnol-XL是迄今为法语训练的最大模型。我们计划训练越来越大且性能越来越强的PAGnol版本,探索法语极致规模模型的能力。在首次发布中,我们聚焦于支撑PAGnol的预训练与缩放计算。我们拟合了法语计算的缩放定律,并与英语对应定律进行比较。我们发现预训练数据集显著决定输出质量,像OSCAR这样的常见数据集会导致低质量的攻击性文本。我们在法语的判别与生成任务上评估了我们的模型,与其他SOTA法语及多语言模型比较,并在摘要生成任务上达到SOTA。我们的研究在公共GENCI Jean Zay超级计算机上进行,我们至Large规模的模型已公开提供。

关键词

引用

@article{arxiv.2110.08554,
  title  = {PAGnol: An Extra-Large French Generative Model},
  author = {Julien Launay and Elena Tommasone and Baptiste Pannier and François Boniface and Amélie Chatelain and Alessandro Cappelli and Iacopo Poli and Djamé Seddah},
  journal= {arXiv preprint arXiv:2110.08554},
  year   = {2022}
}