mGPT:少样本学习器走向多语言
计算与语言
2023-10-13 v2 人工智能
摘要
近期研究报道,自回归语言模型可通过零样本与少样本学习范式成功解决诸多 NLP 任务,这为使用预训练语言模型开辟了新可能。本文引入两个类 GPT 的自回归模型,参数量分别为 13 亿和 130 亿,使用来自 25 个语族的 60 种语言、基于 Wikipedia 与 Colossal Clean Crawled Corpus 训练。我们利用 GPT-2 源码与稀疏注意力机制复现了 GPT-3 架构;Deepspeed 与 Megatron 框架使我们能有效并行化训练与推理步骤。所得模型性能与 Facebook 近期发布的 XGLM 模型相当,覆盖更多语言并增强了独联体国家及俄罗斯小众民族低资源语言的 NLP 可能性。我们详述了架构设计选择的动机,全面描述了数据准备流程,并训练了五个小版本模型以选择最优多语言分词策略。我们测量了所有覆盖语言的模型困惑度,并在广泛的多种语言任务上评估该模型,包括分类、生成、序列标注与知识探测。模型采用零样本与少样本方法评估。此外,我们将分类任务与最先进的多语言模型 XGLM 进行比较。源代码与 mGPT XL 模型已公开发布。
引用
@article{arxiv.2204.07580,
title = {mGPT: Few-Shot Learners Go Multilingual},
author = {Oleh Shliazhko and Alena Fenogenova and Maria Tikhonova and Vladislav Mikhailov and Anastasia Kozlova and Tatiana Shavrina},
journal= {arXiv preprint arXiv:2204.07580},
year = {2023}
}
备注
Accepted for publication at Transactions of the Association for Computational Linguistics (TACL) To be presented at the Conference on Empirical Methods in Natural Language Processing (EMNLP 2023)