中文

MarIA:西班牙语语言模型

计算与语言 2022-04-06 v5 人工智能

摘要

本工作介绍了 MarIA,一个面向工业界与研究界的西班牙语语言模型家族及关联资源。目前,MarIA 包含 RoBERTa-base、RoBERTa-large、GPT2 与 GPT2-large 西班牙语语言模型,可以说它们是规模最大、性能最优的西班牙语语言模型。这些模型使用从西班牙国家图书馆于 2009 至 2019 年间爬取的西班牙网络档案中提取的 570GB 经过清洗与去重、含 1350 亿词的庞杂语料进行预训练。我们利用九个已有评测数据集以及一个全新创建的抽取式问答数据集对模型性能进行了评估。总体而言,MarIA 模型在多种 NLU 任务与训练设定下均优于现有西班牙语模型。

关键词

引用

@article{arxiv.2107.07253,
  title  = {MarIA: Spanish Language Models},
  author = {Asier Gutiérrez-Fandiño and Jordi Armengol-Estapé and Marc Pàmies and Joan Llop-Palao and Joaquín Silveira-Ocampo and Casimiro Pio Carrino and Aitor Gonzalez-Agirre and Carme Armentano-Oller and Carlos Rodriguez-Penagos and Marta Villegas},
  journal= {arXiv preprint arXiv:2107.07253},
  year   = {2022}
}