超大规模英语语言模型的多语言能力探究
计算与语言
2021-08-31 v1 人工智能
摘要
生成式预训练Transformer(GPT)近期在机器学习史上被扩展到前所未有的规模。这些仅以语言建模为目标训练的模型,已在多项不同任务中展现出卓越的少样本学习能力。然而,除轶事性经验外,鉴于预训练语料几乎完全由英文文本构成,人们对其多语言能力知之甚少。本文中,我们考察GPT-3的多语言技能,聚焦于在预训练语料中极少出现的语言——加泰罗尼亚语(Catalan),这使得结果尤为有意义;我们假定我们的结果也与其他语言相关。我们发现该模型表现出色,尤其在生成式任务中,其可预期的局限主要出现在语言理解任务中,但在零样本设定下仍取得显著结果。我们探究了其在抽取式问答与自然语言生成中的潜力与局限,以及模型规模带来的影响。
引用
@article{arxiv.2108.13349,
title = {On the Multilingual Capabilities of Very Large-Scale English Language Models},
author = {Jordi Armengol-Estapé and Ona de Gibert Bonet and Maite Melero},
journal= {arXiv preprint arXiv:2108.13349},
year = {2021}
}