中文

UL2:统一语言学习范式

计算与语言 2023-03-01 v3

摘要

现有的预训练模型通常面向特定类别的问题。迄今为止,关于何种架构与预训练设置才是正确的似乎仍无共识。本文提出一个统一框架,用于预训练在数据集与设置上普遍有效的模型。我们首先将架构原型与预训练目标——两个常被混淆的概念——解耦。接着,我们给出NLP中自监督的广义且统一视角,展示不同预训练目标如何相互转化,以及不同目标间的插值如何有效。然后我们提出去噪器混合(MoD),一种将多种预训练范式结合的预训练目标。我们进一步引入模式切换的概念,其中下游微调与特定预训练方案相关联。我们进行了广泛的消融实验以比较多种预训练目标,发现我们的方法通过跨多个不同设置超越T5与类GPT模型推动了帕累托前沿。通过将模型扩展到20B参数,我们在50个公认的基于监督微调的NLP任务上取得SOTA表现。我们的模型在上下文学习上也取得强劲结果,在零样本SuperGLUE上超越175B GPT-3,并在单样本摘要上达到T5-XXL的三倍表现。在0样本MMLU上,UL2 20B超越T0与T5模型。UL2 20B在思维链提示与推理上也表现良好,使其成为在20B中小规模上研究推理的颇具吸引力的选择。最后,我们将FLAN指令微调应用于UL2 20B模型,取得了与FLAN-PaLM 62B竞争的MMLU与Big-Bench分数。我们发布了基于Flax的T5X检查点,用于UL2 20B与Flan-UL2 20B。

关键词

引用

@article{arxiv.2205.05131,
  title  = {UL2: Unifying Language Learning Paradigms},
  author = {Yi Tay and Mostafa Dehghani and Vinh Q. Tran and Xavier Garcia and Jason Wei and Xuezhi Wang and Hyung Won Chung and Siamak Shakeri and Dara Bahri and Tal Schuster and Huaixiu Steven Zheng and Denny Zhou and Neil Houlsby and Donald Metzler},
  journal= {arXiv preprint arXiv:2205.05131},
  year   = {2023}
}

备注

Updated Q1 2023 with Flan-UL2 20B release! :)