中文

DIET:面向对话系统的轻量级语言理解

计算与语言 2020-05-12 v3

摘要

大规模预训练语言模型在 GLUE 和 SuperGLUE 等语言理解基准测试中展现了出色的结果,相较于分布式表示 (GloVe) 和纯监督方法等其他预训练方法有显著提升。我们引入了双重意图与实体 Transformer (DIET) 架构,并研究了不同的预训练表示在意图预测和实体预测这两个常见对话语言理解任务上的有效性。DIET 在一个复杂的多领域 NLU 数据集上取得了当前最优 (SOTA) 的结果,并在其他更简单的数据集上实现了同样高的性能。令人惊讶的是,我们表明在此任务中使用大型预训练模型并没有明显的益处,事实上,即使在没有任何预训练嵌入的纯监督设置下,DIET 也改进了当前的 SOTA。我们表现最好的模型优于微调的 BERT,且训练速度大约快六倍。

关键词

引用

@article{arxiv.2004.09936,
  title  = {DIET: Lightweight Language Understanding for Dialogue Systems},
  author = {Tanja Bunk and Daksh Varshneya and Vladimir Vlasov and Alan Nichol},
  journal= {arXiv preprint arXiv:2004.09936},
  year   = {2020}
}

备注

v3: Updated results for the best model