中文

AlexaTM 20B:使用大规模多语言 Seq2Seq 模型的少样本学习

计算与语言 2022-08-04 v2 机器学习

摘要

在本工作中,我们证明在去噪与因果语言建模 (CLM) 任务混合上预训练的多语言大规模序列到序列 (seq2seq) 模型,在各种任务上比仅解码器模型更高效的少样本学习器。特别地,我们训练了一个名为 Alexa Teacher Model (AlexaTM 20B) 的 200 亿参数多语言 seq2seq 模型,并展示其在 1-shot 摘要任务上取得最先进 (SOTA) 性能,优于大得多的 540B PaLM 解码器模型。AlexaTM 20B 在 1-shot 机器翻译上也取得 SOTA,尤其对于低资源语言,在模型支持的几乎所有语言对(阿拉伯语、英语、法语、德语、印地语、意大利语、日语、马拉地语、葡萄牙语、西班牙语、泰米尔语和泰卢固语)的 Flores-101 数据集上均如此。我们还展示在零样本设定下,AlexaTM 20B 在 SuperGLUE 和 SQuADv2 数据集上优于 GPT3 (175B),并在 XNLI、XCOPA、Paws-X 和 XWinograd 等多语言任务上提供 SOTA 性能。总体而言,我们的结果为 seq2seq 模型作为仅解码器模型在大规模语言模型 (LLM) 训练中的有力替代给出了令人信服的证据。

关键词

引用

@article{arxiv.2208.01448,
  title  = {AlexaTM 20B: Few-Shot Learning Using a Large-Scale Multilingual Seq2Seq Model},
  author = {Saleh Soltan and Shankar Ananthakrishnan and Jack FitzGerald and Rahul Gupta and Wael Hamza and Haidar Khan and Charith Peris and Stephen Rawls and Andy Rosenbaum and Anna Rumshisky and Chandana Satya Prakash and Mukund Sridhar and Fabian Triefenbach and Apurv Verma and Gokhan Tur and Prem Natarajan},
  journal= {arXiv preprint arXiv:2208.01448},
  year   = {2022}
}