中文

深化预训练语言模型的隐藏表示

计算与语言 2020-04-30 v2

摘要

基于Transformer的预训练语言模型已被证明对学习上下文语言表示是有效的。然而,当前方法在微调下游任务时仅利用编码器最终层的输出。我们认为仅采用单层输出限制了预训练表示的威力。因此我们通过对隐藏表示进行融合来深化模型所学表示,具体通过一个显式的隐藏表示提取器(HIdden Representation Extractor, HIRE),其自动吸收相对于最终层输出的互补表示。以RoBERTa作为主干编码器,我们提出的对预训练模型的改进在多个自然语言理解任务上被证明有效,并帮助我们的模型在GLUE基准上媲美最先进(state-of-the-art, SOTA)模型。

关键词

引用

@article{arxiv.1911.01940,
  title  = {Deepening Hidden Representations from Pre-trained Language Models},
  author = {Junjie Yang and Hai Zhao},
  journal= {arXiv preprint arXiv:1911.01940},
  year   = {2020}
}