中文

AMMUS:自然语言处理中基于 Transformer 的预训练模型综述

计算与语言 2021-08-31 v2

摘要

基于 Transformer 的预训练语言模型(T-PTLMs)在几乎所有 NLP 任务中都取得了巨大成功。这些模型的演进始于 GPT 和 BERT。这些模型构建于 Transformer、自监督学习和迁移学习之上。基于 Transformer 的 PTLMs 利用自监督学习从大规模文本数据中学习通用语言表示,并将该知识迁移到下游任务。这些模型为下游任务提供了良好的背景知识,避免了下游模型从零开始训练。在这篇综合性综述论文中,我们首先简要概述自监督学习。接着,我们解释各种核心概念,如预训练、预训练方法、预训练任务、嵌入和下游适配方法。接下来,我们提出 T-PTLMs 的一种新分类法,然后简要概述包括内在与外在在内的各种基准。我们总结了用于使用 T-PTLMs 的多个有用库。最后,我们强调了一些将进一步提升这些模型的未来研究方向。我们坚信这篇综合性综述论文将作为学习核心概念以及了解 T-PTLMs 近期进展的良好参考。

关键词

引用

@article{arxiv.2108.05542,
  title  = {AMMUS : A Survey of Transformer-based Pretrained Models in Natural Language Processing},
  author = {Katikapalli Subramanyam Kalyan and Ajit Rajasekharan and Sivanesan Sangeetha},
  journal= {arXiv preprint arXiv:2108.05542},
  year   = {2021}
}

备注

Preprint under review