中文

基于预训练语言模型的开放域对话生成

计算与语言 2020-10-27 v1 人工智能

摘要

预训练语言模型已成功用于开放域对话的回复生成。已提出四种主要框架:(1)Transformer-ED,分别使用Transformer编码器和解码器处理源句和目标句;(2)Transformer-Dec,对源句和目标句均使用Transformer解码器;(3)Transformer-MLM,使用Transformer解码器,在源侧应用双向注意力,在目标侧应用自左向右注意力,并采用掩码语言模型目标;(4)Transformer-AR,使用自回归目标替代。在本研究中,我们在3个数据集上比较这些框架,比较表明最佳框架在源侧使用双向注意力且不分离编码器和解码器。我们还考察了模型差异,实验证实模型性能受潜在差异的直接影响。随后我们提出两种校正方法以减少差异,二者均提升了模型性能。这些结果表明,在使用预训练模型时差异是一个重要考量因素,减少差异可带来性能提升。

关键词

引用

@article{arxiv.2010.12780,
  title  = {Open-Domain Dialogue Generation Based on Pre-trained Language Models},
  author = {Yan Zeng and Jian-Yun Nie},
  journal= {arXiv preprint arXiv:2010.12780},
  year   = {2020}
}

备注

[v0], 10 pages, 4 figures