中文

Transformer:NLP 的“历史终结”?

计算与语言 2021-09-24 v2 信息检索 机器学习

摘要

神经架构(如 Transformer)的最新进展,加上 BERT 等大规模预训练模型的出现,彻底改变了自然语言处理(NLP)领域,推动了多项 NLP 任务的最先进水准。此类模型已衍生出丰富的变体家族,如 RoBERTa、ALBERT 和 XLNet,但从根本上说,它们在建模某些信息类型的能力上仍受限,且无法应对某些既有模型轻易处理的信息源。因此,本文旨在阐明预训练 BERT 风格模型中一些重要的理论局限,这些局限源于通用 Transformer 架构本身。首先,我们在两类通用任务——分词与片段标注——及四个数据集上实证表明这些局限确实有害,且以某些非常简单朴素的方式加以解决,即可比原始 RoBERTa 与 XLNet 模型带来可观提升。随后,我们更一般地探讨未来对 Transformer 架构的扩展所需满足的性质,以增强其表达能力,期望能有助于设计下一代深度 NLP 架构。

关键词

引用

@article{arxiv.2105.00813,
  title  = {Transformers: "The End of History" for NLP?},
  author = {Anton Chernyavskiy and Dmitry Ilvovsky and Preslav Nakov},
  journal= {arXiv preprint arXiv:2105.00813},
  year   = {2021}
}

备注

Transformers, Limitations, Segmentation, Sequence Classification, NLP, BERT, RoBERTa, XLNet