中文

用于对话模型训练的对抗式自举方法

计算与语言 2019-09-06 v2 机器学习

摘要

开放域神经对话模型尽管取得了成功,但已知会产生缺乏相关性、多样性且在许多情况下缺乏连贯性的回复。这些缺陷源于常见训练目标直接表达这些性质及其与训练数据集和模型架构相互作用的有限能力。为应对这些问题,本文提出用对抗训练的判别器自举一个对话回复生成器。该方法以自回归和传统教师强制两种模式训练神经生成器,其中自回归输出的最大似然损失由基于度量的判别器模型的分数加权。判别器的输入是真实标签、生成器的教师强制输出以及从数据集中采样的干扰项的混合,从而允许对生成器的自回归输出提供更丰富的反馈。为改进判别器输出的校准,我们还通过真实标签与生成器自回归输出的中间特征匹配来自举判别器。我们探索了训练中不同的采样和对抗策略优化策略,以理解如何在不牺牲相关性的情况下鼓励回复多样性。我们的实验表明,对抗式自举能有效解决暴露偏差(exposure bias)问题,从而改善回复的相关性和连贯性。该改进通过在 Movie 和 Ubuntu 对话数据集上相对于人工评价以及 BLUE、ROGUE 和 distinct n-gram 分数取得的state-of-the-art(SOTA)结果得到证明。

关键词

引用

@article{arxiv.1909.00925,
  title  = {Adversarial Bootstrapping for Dialogue Model Training},
  author = {Oluwatobi Olabiyi and Erik T. Mueller and Christopher Larson and Tarek Lahlou},
  journal= {arXiv preprint arXiv:1909.00925},
  year   = {2019}
}