中文

DLGNet:一种基于 Transformer 的对话响应生成模型

计算与语言 2019-09-06 v2 机器学习 机器学习

摘要

神经对话模型尽管取得了成功,其生成响应仍普遍存在相关性、多样性不足,且在许多情况下连贯性欠缺的问题。这些可归因于以下原因:(1)捕获有限时间依赖的短程模型架构,(2)最大似然训练目标的局限性,(3)对话数据集的凹熵分布导致简短而通用的响应,以及(4)未登录词问题导致生成大量 <UNK> 标记。另一方面,诸如 GPT-2 等基于 transformer 的模型已展现出捕获语言建模任务中长程结构的卓越能力。在本文中,我们提出 DLGNet,一种基于 transformer 的对话建模模型。我们具体考察了 DLGNet 在多轮对话响应生成中的使用。在实验中,我们在开放域 Movie Triples 数据集与封闭域 Ubuntu Dialogue 数据集上评估 DLGNet。DLGNet 模型虽仅以最大似然目标训练,仍相较最先进的多轮对话模型取得显著改进。基于包括 BLEU、ROUGE 与 distinct n-gram 在内的若干指标,它们还在两个数据集上取得迄今最佳性能。我们的分析表明,性能提升主要源于(1)长程 transformer 架构与(2)随机信息填充注入的结合。其他促成因素包括对话上下文与响应的联合建模,以及来自字节对编码(BPE)的 100% 分词覆盖率。

关键词

引用

@article{arxiv.1908.01841,
  title  = {DLGNet: A Transformer-based Model for Dialogue Response Generation},
  author = {Oluwatobi Olabiyi and Erik T. Mueller},
  journal= {arXiv preprint arXiv:1908.01841},
  year   = {2019}
}