基于多语言语言模型的少样本学习
计算与语言
2022-11-11 v3 人工智能
摘要
诸如 GPT-3 的大规模生成式语言模型是具有竞争力的少样本学习器。尽管已知这些模型能够联合表示许多不同语言,但其训练数据以英语为主导,可能限制其跨语言泛化能力。在本工作中,我们在覆盖多种多样语言的语料上训练多语言生成式语言模型,并研究其在广泛任务中的少样本与零样本学习能力。我们最大的具有 75 亿参数的模型在超过 20 种代表性语言的少样本学习中确立了新的最优性能,在多语言常识推理(零样本设置下绝对准确率提升 +7.4%,4 样本设置下 +9.4%)与自然语言推理(零样本与 4 样本设置下各 +5.4%)中优于同等规模的 GPT-3。在 FLORES-101 机器翻译基准上,我们的模型在使用 32 个训练样例时在 182 个方向中的 171 个上优于 GPT-3,同时在 45 个方向上超越官方监督基线。我们对不同的多语言提示方法进行了深入分析,特别表明跨语言的少样本学习性能可通过模板与示范样例的跨语言迁移来实现。最后,我们在五种语言中的仇恨言论检测等社会价值任务上评估了我们的模型,发现其具有与同等规模 GPT-3 模型类似的局限性。
引用
@article{arxiv.2112.10668,
title = {Few-shot Learning with Multilingual Language Models},
author = {Xi Victoria Lin and Todor Mihaylov and Mikel Artetxe and Tianlu Wang and Shuohui Chen and Daniel Simig and Myle Ott and Naman Goyal and Shruti Bhosale and Jingfei Du and Ramakanth Pasunuru and Sam Shleifer and Punit Singh Koura and Vishrav Chaudhary and Brian O'Horo and Jeff Wang and Luke Zettlemoyer and Zornitsa Kozareva and Mona Diab and Veselin Stoyanov and Xian Li},
journal= {arXiv preprint arXiv:2112.10668},
year = {2022}
}
备注
Accepted to EMNLP 2022; 34 pages