中文

用于自然语言理解的多任务深度神经网络

计算与语言 2019-05-31 v2

摘要

本文提出一种多任务深度神经网络(MT-DNN),用于跨多个自然语言理解(NLU)任务学习表示。MT-DNN 不仅利用大量的跨任务数据,还受益于正则化效应,从而产生更通用的表示以适应新任务和领域。MT-DNN 通过引入预训练的双向 transformer 语言模型(即 BERT(Devlin et al., 2018))扩展了 Liu et al. (2015) 提出的模型。MT-DNN 在十个 NLU 任务上取得新的 SOTA 结果,包括 SNLI、SciTail 以及 GLUE 九个任务中的八个,将 GLUE 基准推至 82.7%(绝对提升 2.2%)。我们还利用 SNLI 和 SciTail 数据集证明,与预训练的 BERT 表示相比,MT-DNN 学习的表示可用显著更少的领域内标签进行领域自适应。代码与预训练模型公开于 https://github.com/namisan/mt-dnn。

关键词

引用

@article{arxiv.1901.11504,
  title  = {Multi-Task Deep Neural Networks for Natural Language Understanding},
  author = {Xiaodong Liu and Pengcheng He and Weizhu Chen and Jianfeng Gao},
  journal= {arXiv preprint arXiv:1901.11504},
  year   = {2019}
}

备注

10 pages, 2 figures and 5 tables; Accepted by ACL 2019